⚡ 模型与架构 · 战略发布

从卖芯片到卖AI工作流:英伟达发布Nemotron 3.5与智能模型路由器

企业选模型的标准,正在从“哪个最强”转向“哪个够用、哪个快、哪个划算”。英伟达给出回应:同时推出轻量模型 Nemotron 3.5 Lightning 与模型路由库 NeMo Switchyard。前者补上“执行型”模型的位置,后者解决“模型足够多之后,谁来调度”的问题。

综合公开信息整理 2026-07-22 全文约 3 分钟读完
#英伟达 #Nemotron 3.5 #模型路由 #AI工作流
300亿 Nemotron 3.5 Lightning 总参数量
输出速度提升(vs 同类模型)
30% 智能体任务完成速度提升

⚡ 30 秒速览

  • 发布两项产品:Nemotron 3.5 Lightning(300亿参数MoE模型,单次推理仅激活30亿参数) + NeMo Switchyard(开源模型路由库)。
  • 定位清晰:Lightning 不是取代最强前沿模型,而是成为多智能体系统里的“执行型”模型——代码审查、安全监控、数据处理这类专业化工作。
  • 评测数据:Intelligence Index 得分 24,Terminal-Bench v2.1 拿到 24%,输出速度接近 670 token/s。
  • 快速定制:CodeRabbit 用标准配方训练一个 epoch,约两小时、花 85 美元就产出一个路由智能体。
  • 深层信号:英伟达的角色正在从卖芯片的,变成卖整个 AI 工作流的——只要模型跑在它的路由、推理和部署体系里,它就能从整个工作流中获得价值。

01企业选模型的标准变了

当 AI 智能体成为企业应用的标配,它们承担的任务从成批的简单小任务,一路延伸到需要跨深度知识领域的复杂推理。前者交给能快速处理批量小任务的轻量模型即可,后者才需要高智能、强推理的前沿模型。

问题已经不再是谁的算力更强,而是哪一个任务该交给哪一个模型

旧标准:哪个模型最强

追求单一模型在所有任务上的绝对领先,成本高、延迟大、资源浪费严重。

新标准:哪个够用、快、划算

按任务场景动态选择模型,轻量级任务交给小模型,复杂推理留给大模型,整体性价比最优。

英伟达今天的两个发布,是对这条逻辑的直接回应。

02Nemotron 3.5 Lightning:为“执行”而生的轻模型

Nemotron 3.5 Lightning 是一个总参数约300亿的混合专家模型,单次推理只激活约30亿参数。英伟达称,相比同类模型,它的输出速度最高提升约4倍,智能体任务完成速度提升约30%

需要厘清一个落差:输出快 4 倍,并不意味着整个任务能快 4 倍。模型推理只是智能体工作流的一环,工具调用、API 响应、多智能体之间的任务编排都会形成新的瓶颈,实际任务提速被压缩到约 30%。

这也是英伟达在同一个节点端出 Switchyard 的原因——只解决“单个模型跑得快”远远不够,还要解决“每一步该用哪个模型”。

24Intelligence Index
824GDPval-AA v2 Elo
24%Terminal-Bench v2.1
670输出速度 (token/s)

注:Intelligence Index 得分 24,比上一代小尺寸型号 Nemotron 3 Nano 高出 9 分,与 OpenAI 的 gpt-oss-120b 相当,仅落后于规模约为其 4 倍的 Nemotron 3 Super 2 分。Terminal-Bench 上 Nemotron 3 Nano 仅 7%。

03评测榜单:执行能力已追赶前沿

第三方评测机构 Artificial Analysis 的数据印证了 Lightning 的执行能力。以下为 Intelligence Index 关键对比:

🥇 Nemotron 3.5 Lightning英伟达 · 300亿参数
24
gpt-oss-120bOpenAI
23
Nemotron 3 Super英伟达 · 约1万亿参数
26
Nemotron 3 Nano英伟达 · 小尺寸
15

注:柱形自 12 分起缩放,非零起点;分差以标注分数为准。Lightning 以约 1/4 的参数量达到 Super 92% 的得分。

04NeMo Switchyard:模型路由成为新软件层

模型足够多之后,路由成为新软件层。

NeMo Switchyard 是一个开源的模型路由库。它会考虑当前有多少模型可用、各自能力如何,在智能体工作流的每一步,把请求路由到当时最合适、最高效的模型。开发者可以根据质量、延迟、成本等优先级,自定义路由策略。

当前任务路由决策选择最合适模型执行并返回

对未来的多智能体系统而言,真正重要的或许已经不是“哪个模型最好”,而是哪个任务该由哪个模型完成。企业不必让每一个任务都用最贵的模型。

英伟达已与 Boom、Cadence、Cognition、Kong、Langchain、Nous Research、Siemens 等一批生态伙伴合作,把智能路由接入开发者已在使用的工具。

05“把后训练变成按洗碗机按钮”

Lightning 的另一重差异化在于它开放且易于定制。企业可以在自己的硬件上,用 NeMo 针对专有领域数据、工具和工作流进行二次训练。

🐰 CodeRabbit:两小时、85 美元产出一个路由智能体 一键定制

  • 用英伟达的标准模型配方训练了一个 epoch,约两小时,花费仅85 美元
  • 直接产出可用于代码审查的路由智能体,无需额外改造。
英伟达生成式AI副总裁 Kari Briski 说:“这正在把后训练和微调变成把碗放进洗碗机、然后按下启动键。”

⚡ 单卡训练:一张 H100 搞定

  • 一个合作伙伴用单张 H100 卡就完成了训练。
  • 另一个公司干脆晚上跑训练任务,早上来取结果
  • 英伟达同时放出了数据集、后训练数据集,以及训练模型所用的配方和框架。
开发者可以把英伟达的后训练数据与企业自有数据混在一起,做出“取两家之长”的混合模型。

06为什么是英伟达?

把 Lightning 和 Switchyard 放在一起看,英伟达的判断清晰可见:随着模型数量越来越多,模型之间的调度和协同会成为新的软件层。

一个诚实的注脚:英伟达的处境微妙。其芯片需求高度集中于 OpenAI、微软、SpaceX 等少数前沿实验室和云服务商,而英伟达已向 OpenAI 投资 300 亿美元;另一边,Nemotron 4 恰恰定位为企业提供成本更低的替代方案,与这些前沿实验室形成竞争。它一边给客户供芯片,一边下场造模型,边界正在变得模糊。

不过对英伟达而言,这未必是零和游戏。AI 模型评测机构 Arena 首席执行官的一句话点破逻辑:“无论哪家公司做出优秀的开源模型,英伟达都是赢家。”开源生态越繁荣、参与主体越多元,GPU 的整体需求就越旺盛。

编辑核心判断

英伟达的角色正在从卖芯片的,变成卖整个 AI 工作流的。只要模型跑在英伟达的路由、推理和部署体系里,无论企业最终选择谁的模型,它都能从整个工作流中获得价值。这才是 Switchyard 与 Nemotron 3.5 放在一起发布的真正含义。

开发者入口

Nemotron 3.5 Lightning 权重与 NeMo Switchyard 开源仓库已发布,开发者可结合 NeMo 框架进行定制化训练。英伟达同时放出了完整数据集、后训练配方与评估工具。

获取开源资源 → NVIDIA NeMo