从卖芯片到卖AI工作流:英伟达发布Nemotron 3.5与智能模型路由器
企业选模型的标准,正在从“哪个最强”转向“哪个够用、哪个快、哪个划算”。英伟达给出回应:同时推出轻量模型 Nemotron 3.5 Lightning 与模型路由库 NeMo Switchyard。前者补上“执行型”模型的位置,后者解决“模型足够多之后,谁来调度”的问题。
企业选模型的标准,正在从“哪个最强”转向“哪个够用、哪个快、哪个划算”。英伟达给出回应:同时推出轻量模型 Nemotron 3.5 Lightning 与模型路由库 NeMo Switchyard。前者补上“执行型”模型的位置,后者解决“模型足够多之后,谁来调度”的问题。
当 AI 智能体成为企业应用的标配,它们承担的任务从成批的简单小任务,一路延伸到需要跨深度知识领域的复杂推理。前者交给能快速处理批量小任务的轻量模型即可,后者才需要高智能、强推理的前沿模型。
问题已经不再是谁的算力更强,而是哪一个任务该交给哪一个模型。
追求单一模型在所有任务上的绝对领先,成本高、延迟大、资源浪费严重。
按任务场景动态选择模型,轻量级任务交给小模型,复杂推理留给大模型,整体性价比最优。
英伟达今天的两个发布,是对这条逻辑的直接回应。
Nemotron 3.5 Lightning 是一个总参数约300亿的混合专家模型,单次推理只激活约30亿参数。英伟达称,相比同类模型,它的输出速度最高提升约4倍,智能体任务完成速度提升约30%。
需要厘清一个落差:输出快 4 倍,并不意味着整个任务能快 4 倍。模型推理只是智能体工作流的一环,工具调用、API 响应、多智能体之间的任务编排都会形成新的瓶颈,实际任务提速被压缩到约 30%。
这也是英伟达在同一个节点端出 Switchyard 的原因——只解决“单个模型跑得快”远远不够,还要解决“每一步该用哪个模型”。
注:Intelligence Index 得分 24,比上一代小尺寸型号 Nemotron 3 Nano 高出 9 分,与 OpenAI 的 gpt-oss-120b 相当,仅落后于规模约为其 4 倍的 Nemotron 3 Super 2 分。Terminal-Bench 上 Nemotron 3 Nano 仅 7%。
第三方评测机构 Artificial Analysis 的数据印证了 Lightning 的执行能力。以下为 Intelligence Index 关键对比:
注:柱形自 12 分起缩放,非零起点;分差以标注分数为准。Lightning 以约 1/4 的参数量达到 Super 92% 的得分。
模型足够多之后,路由成为新软件层。
NeMo Switchyard 是一个开源的模型路由库。它会考虑当前有多少模型可用、各自能力如何,在智能体工作流的每一步,把请求路由到当时最合适、最高效的模型。开发者可以根据质量、延迟、成本等优先级,自定义路由策略。
对未来的多智能体系统而言,真正重要的或许已经不是“哪个模型最好”,而是哪个任务该由哪个模型完成。企业不必让每一个任务都用最贵的模型。
英伟达已与 Boom、Cadence、Cognition、Kong、Langchain、Nous Research、Siemens 等一批生态伙伴合作,把智能路由接入开发者已在使用的工具。
Lightning 的另一重差异化在于它开放且易于定制。企业可以在自己的硬件上,用 NeMo 针对专有领域数据、工具和工作流进行二次训练。
把 Lightning 和 Switchyard 放在一起看,英伟达的判断清晰可见:随着模型数量越来越多,模型之间的调度和协同会成为新的软件层。
一个诚实的注脚:英伟达的处境微妙。其芯片需求高度集中于 OpenAI、微软、SpaceX 等少数前沿实验室和云服务商,而英伟达已向 OpenAI 投资 300 亿美元;另一边,Nemotron 4 恰恰定位为企业提供成本更低的替代方案,与这些前沿实验室形成竞争。它一边给客户供芯片,一边下场造模型,边界正在变得模糊。
不过对英伟达而言,这未必是零和游戏。AI 模型评测机构 Arena 首席执行官的一句话点破逻辑:“无论哪家公司做出优秀的开源模型,英伟达都是赢家。”开源生态越繁荣、参与主体越多元,GPU 的整体需求就越旺盛。
英伟达的角色正在从卖芯片的,变成卖整个 AI 工作流的。只要模型跑在英伟达的路由、推理和部署体系里,无论企业最终选择谁的模型,它都能从整个工作流中获得价值。这才是 Switchyard 与 Nemotron 3.5 放在一起发布的真正含义。
Nemotron 3.5 Lightning 权重与 NeMo Switchyard 开源仓库已发布,开发者可结合 NeMo 框架进行定制化训练。英伟达同时放出了完整数据集、后训练配方与评估工具。
获取开源资源 → NVIDIA NeMo