NVIDIA Nemotron 3 Embed 首发上线 Bitdeer AI Model Studio,为智能体构建更高效的检索机制

Banner

当 AI 智能体给出错误答案时,人们很容易将责任归咎于模型的推理能力。但在生产环境的智能体系统中,故障往往发生在更早的一步,即检索环节。如果检索层遗漏了正确的段落、代码文件、策略或特定客户的记录,下游智能体就会从错误的上下文开始运行,再强大的推理能力也无法挽救糟糕的起点。

智能体会非常频繁地进行检索,它们将任务分解为多个查询,不断重写查询直到提取出正确的数据,搜索记忆,并在单次任务中对代码进行数十次检查。每次表现不佳的检索,都会徒增交互轮数、Token 消耗、系统延迟以及产生幻觉的风险。随着企业从简单的语义搜索向检索驱动的 AI 系统演进,检索质量已成为控制系统准确率、成本与信任度的核心环节

今天,NVIDIA Nemotron 3 Embed 8BNVIDIA Nemotron 3 Embed 1B 正式在 Bitdeer AI Model Studio 平台上线,为 RAG(检索增强生成)、企业搜索、代码检索和智能体工作流带来了可用于生产环境的开源嵌入模型。您可以通过 Bitdeer AI Model Studio 专为安全且可扩展的企业 AI 打造的无服务器推理平台,立即部署这些模型。

什么是 NVIDIA Nemotron 3 Embed?

Nemotron 3 Embed 是一组开源嵌入模型系列,专为那些构建企业搜索系统和新兴智能体工作流的企业及独立软件供应商 (ISV) 团队而设计。本次发布的两款模型,为开发者提供兼顾准确率与效率的理想选择:

  • Nemotron 3 Embed 8B: 一款前沿的嵌入模型,旨在各大主要检索基准测试中树立准确率天花板。该模型在综合了开源和闭源嵌入模型的 RTEB 排行榜上位列榜首。
  • Nemotron 3 Embed 1B: 一款高效的嵌入模型,通过剪枝、蒸馏和量化感知训练 (QAT),保留了 8B 模型 95% 以上的准确率,专为需要高准确率、同时在吞吐量和服务部署效率上有更高要求的高强度生产工作负载而构建。

设计理念非常明确: 在极致检索质量至关重要的场景下使用 8B 模型,在需要高效处理高并发工作负载的场景下使用 1B 模型。二者的结合,让团队在提升检索质量的同时,无需在算力资源上做出不切实际的妥协。

核心技术规格

Property

Details

Models

Nemotron 3 Embed 8B / Nemotron 3 Embed 1B (nemotron-3-embed-8b / nemotron-3-embed-1b)

Architecture

Transformer (Ministral-3-3B-Instruct-2512 based pruned model)

Modalities

Text-only input and output, including code (multimodal planned for a future release)

Context Length

32K tokens

Quantization

8B: BF16 · 1B: BF16 & NVFP4

Openness

Open model weights, datasets, training recipes, and fine-tuning guidance

NVIDIA Technology

NeMo Retriever Library, NVIDIA NIM, NeMo AutoModel, NVIDIA Model Opt

Supported GPUs

H100, RTX Pro 6000 Blackwell, GB200

为何检索质量如今决定了智能体的质量?

大多数企业级检索技术栈都面临着一系列艰难的权衡:

  • 准确率 vs. 成本: 更好的检索质量通常意味着每次查询的费用更高。
  • 准确率 vs. 模型参数量: 较大的嵌入模型可以提升检索质量,但难以在规模化部署中提供服务。
  • 延迟 vs. 召回率: 生产系统需要极速的查询响应,但高质量检索往往意味着需要搜索海量内容。
  • 开放程度 vs. 生产就绪度: 开源模型支持定制化微调,但团队仍然需要经过实战测试的部署路径、量化支持以及企业级的服务能力。

这种权衡在智能体系统中体现得最为明显。多轮交互智能体会为了进行规划、提取记忆、查找代码以及获取工具使用的上下文而反复检索。薄弱的检索能力会增加交互轮数、Token 消耗、产生幻觉的风险,并导致用户体验下降。而强大的检索能力则能够减少无关的上下文,确保智能体的生成内容始终锚定事实 (Grounded)。若要让检索成为智能体默认的基础能力,嵌入模型就必须做到像本地文件搜索一样简单易用:快速、廉价、精准,并且不需要在算力上做出重大妥协。

Nemotron 3 Embed 正面解决了这些问题:

  • 为检索智能体提供前沿准确率。 Nemotron 3 Embed 模型在企业搜索、RAG、代码检索和智能体检索工作流中均提供了顶尖的检索准确率。Nemotron 3 Embed 8B 在 RTEB 排行榜上击败了其他开源和闭源嵌入模型,其设计旨在以最少的 Token 消耗实现开源嵌入模型中最高的智能体检索准确率。
  • 兼顾高效且无需不切实际的算力妥协。 Nemotron 3 Embed 1B 通过剪枝、蒸馏和量化感知训练保留了 8B 模型 95% 以上的准确率,而其在 NVIDIA Blackwell 上对 NVFP4 的支持更是使吞吐量翻倍。这使得语义搜索变得足够快速且低成本,智能体可以像进行文件搜索一样持续高频地进行检索。在 NVIDIA Blackwell GPU 上,NVFP4 版本的吞吐量提升了 2 倍,同时保持了 99% 的 BF16 准确率。
  • 从权重到训练方法全面开源透明。 Nemotron 3 Embed 发布时全面开放了模型权重、数据集、训练配方、优化技术和微调指南。团队可以检查模型的构建过程,针对特定领域的检索进行微调,并能在对自身数据和基础设施拥有完全控制权的前提下进行部署:告别黑盒,拒绝供应商绑定。

企业级应用场景

  • 智能体检索 (Agentic Retrieval): 为智能体提供更强大的检索层,助力多轮规划、工具调用、记忆提取及重复查找循环。Nemotron 3 Embed 支持查询分解(智能体将单一用户请求拆分为多个检索查询)和查询重写(智能体多次重新构建查询语句直至检索到准确数据)。
  • RAG 与企业搜索: 凭借前沿级别的检索精准度,将 Copilot(副驾驶助手)和 RAG 流水线锚定在正确的企业上下文文档、知识库和策略中,减少无关上下文并降低下游 Token 的浪费。
  • 代码检索: 为开发者 Copilot 和软件工程智能体准确检索相关的源文件、函数和实现示例。凭借将文本和代码嵌入集于单一模型中的优势,工程团队能够通过同一个检索层同时支持代码搜索与代码智能体的上下文需求。

在 Bitdeer AI Model Studio 通过 API 运行 Nemotron 3 Embed

即日起,您可在 Bitdeer AI Model Studio 平台上运行 Nemotron 3 Embed,这是我们推出的无服务器推理平台,旨在简化对先进基础模型的访问并提供卓越的可扩展性。通过统一的 API 接口,Model Studio 允许开发者和企业无需管理底层基础设施即可快速上手使用模型,从而显著降低部署复杂性并缩短变现时间。

Bitdeer AI 是 NVIDIA 优选云合作伙伴 (Preferred NVIDIA Cloud Partner),获得 ISO/IEC 27001:2022 以及 SOC2 Type I & Type II 认证,致力于提供生产级检索与智能体 AI 部署所需的高安全性、合规性、高性能和企业级标准的基础设施。欢迎在 Bitdeer AI 专为 AI 工作流打造的 GPU 算力集群上,以满足您业务需求的精度和规模运行嵌入工作负载。

快速入门

  1. 登录 Bitdeer AI Model Studio
  2. 在模型列表中选择 NVIDIA Nemotron 3 Embed 8BNVIDIA Nemotron 3 Embed 1B
  1. 生成 API 密钥 (API Key),并开始发起嵌入 API 调用:
NVIDIA Nemotron 3 Embed 1B:
curl -v --location 'https://api-inference.bitdeer.ai/v1/embeddings' --data '{"model":"nvidia/Nemotron-3-Embed-1B-BF16","input":"The cat danced gracefully under the moonlight, its shadow twirling like a silent partner."}' --header 'Authorization: Bearer <API_KEY>'
NVIDIA Nemotron 3 Embed 8B
curl -v --location 'https://api-inference.bitdeer.ai/v1/embeddings' --data '{"model":"nvidia/Nemotron-3-Embed-8B-BF16","input":"The cat danced gracefully under the moonlight, its shadow twirling like a silent partner."}' --header 'Authorization: Bearer <API_KEY>'

结语

检索正成为企业级 AI 应用的关键一环,其决定了智能体是立足事实还是偏离正轨,决定了每一个推理循环是有效应用于正确的上下文,还是白白浪费在错误的信息上。NVIDIA Nemotron 3 Embed 将前沿的检索精准度带入了企业实战部署环节:8B 模型树立了准确率的行业天花板,1B 模型将这种高质量带入高吞吐量的生产环境,并做到了从模型权重到训练方法的全面开源。凭借在 Bitdeer AI Model Studio 的首发 (Day-0) 同步上线,即日起,您便可着手构建更高质量的 RAG、搜索引擎和智能体检索系统,用更精准的上下文、更少的 Token 浪费,打造出更具事实依据的 AI 体系。