⚡ 开源 · 双产品发布

英伟达开源双响炮:Nemotron 3.5 Lightning速度提升4倍,Agent任务成本降至1/3

8月11日,英伟达在签署开源AI公开信后首次拿出开源模型:Nemotron 3.5 Lightning总参数300亿、每次推理仅激活约30亿,输出速度最高达同规模模型的4倍;配套开源的NeMo Switchyard路由库,把Agent执行成本砍至全部使用Claude Opus 4.8时的约1/3

来源:公开信息整理 2026-08-12 全文约4分钟读完
#英伟达 #开源大模型 #Nemotron #Agent路由
300亿→30亿 总参数与每次激活参数·混合专家架构
4 输出速度最高达同等规模模型
1/3 Agent任务成本·对照全用Claude Opus 4.8

30 秒速览

  • 首份开源答卷:7月24日签署开源AI公开信后,英伟达8月11日发布Nemotron 3.5 Lightning与NeMo Switchyard。
  • 性能卡位:总参数300亿/激活约30亿,Artificial Analysis显示其处于小参数量模型的"帕累托前沿"。
  • 任务效率:PinchBench中86%准确率完成1万项Agent任务,同等准确率下比Qwen 3.6 35B快30%。
  • 成本账:Switchyard不限于英伟达自家模型;LangChain实测成本降74%,仅7%请求留给前沿模型。
  • 万亿在途:Nemotron 4最大版本预计至少1万亿参数,约为Nemotron 3 Ultra两倍,尚未完成训练。
  • 一句提醒:"4倍速度"是特定部署环境下的峰值,不等于综合智能全面领先。

01开源信之后的第一次出手 从签字到交付,不到三周

7月24日,英伟达在支持开源AI模型的联名公开信上签了名。不到三周后,它交出了自己的答卷——不是白皮书,不是路线图,而是两个可以直接下载的开源项目。

这次的出手,是双倍的。

Nemotron 3.5 Lightning——黄仁勋称之为"智能、快速、高效且开源",专为持续运行、长时间工作的Agent设计。NeMo Switchyard——一个在多模型之间按需分配任务的智能路由库,目标是把长程Agent的成本和延迟压下来。

7月24日

英伟达签署支持开源AI模型的联名公开信

8月11日

Nemotron 3.5 Lightning 与 NeMo Switchyard 同日开源

8月11日

模型同步上架Hugging Face、ModelScope、OpenRouter及官方开发者平台

注:时间线信息综合公开报道整理。

02两个独立评测,指向同一个结论 不只看官方数据

一个模型是不是真能打,要看它站在别人的考场上表现如何。两个独立评测给出了相当一致的画面。

🧪 Artificial Analysis

  • 综合能力得分 24
  • 输出速度约 670 token/s
  • 总参数低于400亿的开放权重模型中,唯一进入高速度+高得分区域

🤖 PinchBench

  • 86%准确率完成 1万项Agent任务
  • 同等准确率下,比 Qwen 3.6 35B30%
  • 更侧重Agent真实任务的完整交付

注:两个评测的指标不可直接互换——Artificial Analysis侧重模型本体能力与生成速度,PinchBench侧重Agent任务完成效率。

速度的账,靠的是架构。

03快4倍,靠四个技术支点 AI Agent 的"工作模型"

Nemotron 3.5 Lightning采用混合专家架构:总参数300亿,但处理每个token时只激活约30亿参数——用更少的计算做更多的事,这是速度的第一层来源。

⚙️ 混合专家架构

路由只调用少量专家模块,保留300亿总容量的同时,把单次推理的计算开销大幅压低。

🔮 多Token预测

训练中学习提前推测后续多个token,再逐项验证,减少一步步「挤牙膏」式生成。

⚡ 推测解码

配套DSpark、DFlash两款草稿模型快速生成候选内容,再统一校验,加速推理。

🎯 低精度量化

提供BF16与NVFP4双版本,可跑在RTX 5090、DGX Spark等本地硬件上。

在英伟达的规划里,它不负责复杂推理,而是做Agent的"工作模型"——承担工具调用、结果检查、格式整理、代码运行这些高频且流程相对固定的操作。复杂的规划与编排,交给Nemotron 3 Ultra这类前沿模型。

注:CrowdStrike、Harvey、CodeRabbit等公司已分别探索将其用于网络安全、法律服务和代码审查;也有团队在针对软件开发、金融、医疗场景做垂直微调。

04省钱的路由器:NeMo Switchyard 不让每一环都用最贵的模型

真正把成本系统性降下来的,是第二个开源产品。

Agent执行长程任务,要经历规划、检索、工具调用、结果验证、纠错等环节。每个环节对模型能力、响应速度和成本的要求完全不同——都用最强的模型,是巨大的浪费。NeMo Switchyard就是那个分发请求的"调度中枢"。

🗂️ 分类路由器 按任务所属领域选择模型
🔄 阶段路由器 按Agent执行阶段与工具使用情况切换
📈 升级路由器 低成本模型兜底,不可靠时再升级到更强模型
接收请求评估难度/上下文分配模型返回结果

注:Switchyard不锁死英伟达自家模型,开源与闭源模型均可接入;开发者可按准确率、速度、成本自定义路由策略。

05合作方的账单:省钱是真的,代价也是真的

英伟达内部测试显示:与全部任务使用Claude Opus 4.8相比,Switchyard能在保持接近其准确率的前提下,把任务完成成本降至约1/3

第三方数据,更值得看。

LangChain成本 −74%

  • 145项多轮Agent任务实测
  • 7% 的请求交给Claude Opus 4.8
  • 总体成本降低 74%,准确率下降约 6个百分点
诚实的代价:省钱不是免费的——6个百分点的准确率换74%的成本降幅,合不合算,取决于你的任务容错度。

Cognition · Devin Desktop成本 −28%

  • 采用阶段路由方法
  • 平均成本比"全部请求使用同一前沿模型"降低 28%
阶段路由的意义:按执行阶段切换模型,而不是一刀切——适合长链路、混合难度的Agent任务。

Ramp Labs · Ramp SWE-Bench成本 −58%

  • 自研软件工程评测基准实测
  • 测试成本降低 58%
  • 运行时间缩短 33%
含金量:在真实软件工程任务上验证,数字比宣传更克制。

这些账单指向一个事实:模型路由正在成为Agent成本结构的新变量。用对环节,省钱立竿见影;但准确率下降与任务失败的隐性成本,同样要算在账上。

06万亿参数模型,还在路上 Nemotron 4 被曝在研

开源双响炮之外,英伟达的牌桌上还有一张更大的牌。据公开报道,Nemotron 4系列正在研发中,最大版本预计至少1万亿参数,约为Nemotron 3 Ultra的两倍,目标直指全球领先开源模型的水平。但训练尚未完成,具体规格与发布时间都还没敲定。

Nemotron 3 Ultra
基准
Nemotron 4(在研)
≥2x

注:条长为相对比例示意(约两倍关系),非精确参数对比;以官方最终发布为准。

英伟达为什么亲自下场做模型?两个目的:一是用模型开发反向优化芯片与软件栈;二是用高质量开源模型降低企业使用AI的门槛——越多企业做训练、微调、部署,GPU需求盘子就越大。

但这让英伟达与客户的关系变得微妙。OpenAI和Anthropic是它芯片的大买家,Reflection AI等开源模型公司又拿过英伟达的投资。自己下场做高性能模型,等于在伙伴的赛道里放了一个"自己"。

编辑核心判断

英伟达这次没有押注"一个模型打天下",而是把执行和调度拆成两个开源项目:Lightning负责便宜地干活,Switchyard负责聪明地分配。当Agent从一次性问答走向持续运行,模型路由将变成基础设施的默认层——谁能把"分配"做到最顺,谁就掌握下一代AI应用的成本曲线。真正的风险不是技术,而是英伟达越深入模型层,与自家客户的边界就越难画清。

现在就能用

两个开源项目均已面向开发者开放下载与调用:

Nemotron 3.5 Lightning Hugging Face · ModelScope · OpenRouter · 英伟达开发者平台
NeMo Switchyard GitHub 开源 · 支持开源与闭源模型混编调度