NVIDIA Nemotron 3.5 Lightning 首发上线 Bitdeer AI Model Studio,赋能“全天候运行”智能体

blog banner

当“全天候运行”智能体运行卡顿或产生高额账单时,用户的直觉往往是去寻求一个规模更大、更智能的模型,但大多数智能体的工作并非前沿推理任务。“全天候运行”智能体通过收集上下文、观察环境、基于已知信息推理并执行动作来完成复杂的多步骤任务,而这一过程的每一步都需要调用语言模型。这些步骤往往具有高频、重复且特定于领域的特征:这正是较小、专业且可控的模型,相较于前沿模型更快速、更具成本效益的优势领域。

这也正是“模型系统(Systems of Models)”背后的核心逻辑:与其把每一个步骤都交给同一个大模型处理,智能体应该为每一步任务匹配最合适的模型,在需要协调调度和高难度推理的环节使用前沿模型的能力,而在高频、重复的环节则交给专精模型完成。

今天,NVIDIA Nemotron 3.5 Lightning,这一同级别中面向“全天候运行”速度最快的开源模型,正式首发上线 Bitdeer AI Model Studio。用户可在 Model Studio 这一专为安全、可扩展企业级 AI 打造的无服务器推理平台部署使用,无需自行管理复杂底层基础设施。

什么是 NVIDIA Nemotron 3.5 Lightning?

NVIDIA Nemotron 3.5 Lightning 是一款 300 亿参数的混合专家模型(Mixture-of-Experts,MoE),激活参数为 30 亿,由 NVIDIA 前沿模型 Nemotron 3 Ultra 蒸馏而来。它是一款完全可定制的开源模型,专为驱动生产环境中的“全天候运行”AI 智能体而打造,赋予企业自主掌控模型、针对特定任务进行后训练(post-train),并将其部署到智能体实际运行的任何环境中的能力。

该模型由 Nemotron Coalition 共同开发,并针对主流智能体框架(agent harness)进行了优化。Nemotron 3.5 Lightning 在代码生成、工具调用、指令遵循以及多轮对话工作流方面均具备领先的准确率,能够帮助智能体更快完成专项任务。该模型天生适配“模型系统”架构:诸如 NVIDIA NeMo Switchyard 这样的路由系统,可以在指定的模型池中智能地将智能体工作流的每一步导向最合适的模型:当 Nemotron 3.5 Lightning 在准确率、速度和部署灵活性方面最匹配某类高频专项任务时,路由系统便会选择调用它。

该模型围绕三大核心优势构建:

  • 模型可控性:作为一款采用开放数据集训练的开源模型,企业可以对其进行掌控、定制,并部署到边缘设备、本地环境或数据中心,同时管理模型行为、数据处理方式与智能体工作流。
  • 可定制实现高准确率:模型已针对主流智能体框架进行训练,在智能体任务中开箱即用即可实现出色的准确率表现,同时支持针对特定工作流进行后训练,以进一步提升在具体企业场景中的准确率。
  • 快速完成任务:吞吐量最高可提升 4 倍,配合高效的 Token 生成机制,帮助“全天候运行”智能体和个人智能体在更短时间内完成更多步骤,加快专项任务的完成速度,同时降低推理成本。

关键规格参数

Property

Details

Model

NVIDIA Nemotron 3.5 Lightning

Architecture

Hybrid Mixture-of-Experts (MoE), distilled from NVIDIA Nemotron 3 Ultra

Model size

30B total parameters · 3B active parameters

Generation

Multi-token prediction

Context length

Up to 1M tokens

Modalities

Text input, text output

Precision

Early access: BF16 · General availability: NVFP4

Openness

Open model weights and open training datasets; customizable and post-trainable

NVIDIA technology

Built for popular agent harnesses; routable via NVIDIA NeMo Switchyard

Supported GPUs

NVIDIA H100, H200, A100, L40S, GB200/B200, GB300/B300, RTX Pro 6000, and DGX Spark (B10)

为何"模型系统"理念正在决定智能体的经济性

随着企业将全天候运行智能体推向生产环境,权衡关系正变得愈发清晰:

  • 能力与成本:把每一个步骤都交给前沿模型处理的成本较为高昂,尤其是当大多数步骤本身都是高频、重复性的工作。
  • 能力与速度:更大的模型会给每一轮交互增加延迟,而“全天候运行”智能体需要运行成百上千轮交互。
  • 通用模型与专精模型:单一的通用模型很难在特定企业场景中匹敌经过针对性后训练的专精模型。
  • 开放性与生产可用性:开放模型固然可以被企业掌控和定制,但团队仍然需要经过充分验证、达到企业级标准的服务基础设施才能实现大规模稳定运行。

Nemotron 3.5 Lightning 正是为直接解决上述问题而设计:

  • 掌控与自主权:作为一款基于开放数据集训练的开放模型,Nemotron 3.5 Lightning 让企业能够自主掌控模型行为、数据处理方式与智能体工作流,并可将其部署到智能体实际运行的任何位置,从边缘设备到数据中心与云端,一应俱全。
  • 面向专项场景的精准优化:模型针对主流智能体框架进行了训练,在智能体任务中开箱即用即可实现出色的准确率表现,并可针对特定工作流进一步后训练,从而在企业真正关心的具体业务场景中,让“小模型”实现优于“通用大模型”的表现。
  • 更快完成任务:高 Token 生成吞吐量使每一步的延迟与成本都保持在较低水平,让全天候运行智能体能够在同等时间内运行更多步骤、更快完成专项任务。根据 NVIDIA 的初步基准测试结果,在多轮智能体工作负载场景下,Nemotron 3.5 Lightning 的吞吐量最高可达同类开放模型的 4 倍,从而使智能体能够更快完成专项任务。

企业级应用场景

全天候个人与生产力智能体:为处理邮件、日程、项目管理与预订等日常任务的长期运行助手提供支持,尤其适合那些高频、重复性步骤能够充分受益于快速、可控模型的场景。

金融服务工作流:运行专项智能体,完成文档数据提取、合规规则核查、风险信号监测,以及结构化摘要生成等任务。
网络安全运营:驱动专项安全智能体完成告警、事件分类、日志查询、控制项验证、指标关联,并为分析师生成结构化分析结果。
电信行业:支持自动化网络运维与主动式客户服务,包括网络告警分类处理、配置优化,以及账单问题解答。
零售行业:丰富商品目录信息、处理库存与履约异常、辅助商品发现,并解答订单、退货或会员积分相关问题。

在 Bitdeer AI Model Studio 上通过 API 调用 Nemotron 3.5 Lightning

即日起,您可在 Bitdeer AI Model Studio 平台上运行 Nemotron 3.5 Lightning,这是我们推出的无服务器推理平台,旨在简化对先进基础模型的访问并提供卓越的可扩展性。通过统一的 API 接口,Model Studio 允许开发者和企业无需管理底层基础设施即可快速上手使用模型,从而显著降低部署复杂性并缩短变现时间。

Bitdeer AI 是 NVIDIA 优选云合作伙伴(Preferred NVIDIA Cloud Partner),获得 ISO/IEC 27001:2022 以及 SOC2 Type I & Type II 认证,致力于提供生产级检索与智能体 AI 部署所需的高安全性、合规性、高性能和企业级标准的基础设施。

如何开始

  1. 登录 Bitdeer AI Model Studio
  2. 在模型列表中找到 NVIDIA Nemotron 3.5 Lightning。
  1. 生成 API Key 并开始调用。
curl -v --location 'https://api-inference.bitdeer.ai/v1/chat/completions' --data '{"model":"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","messages":[{"role":"system","content":"You are a knowledgeable assistant. Provide concise and clear explanations to scientific questions."},{"role":"user","content":"Can you explain the theory of evolution in simple terms?"}],"max_tokens":4096,"top_p":1.0,"temperature":1.0,"frequency_penalty":0.0,"presence_penalty":0.0,"seed":0,"stream":false}' --header 'Authorization: Bearer <API_KEY>'

结语

全天候运行智能体不需要一个“万能大模型”来处理每一步工作,而是根据需要选择最合适的模型。NVIDIA Nemotron 3.5 Lightning 为这一架构带来了完全可定制的开源模型:它是一款拥有 3B 活跃参数的 30B MoE 模型,蒸馏自前沿模型,适配主流智能体框架,专为高频专业工作负载的高吞吐量而设计。NVIDIA Nemotron 3.5 Lightning 在 Bitdeer AI Model Studio 上首发上线,您可以立即开始将智能体的专业任务路由至一个您可以拥有、定制并大规模运行的模型,在实现更高吞吐量、更低延迟和更低推理成本的同时,保持对数据和工作流的完全控制。