英伟达开源双响炮:Nemotron 3.5 Lightning速度提升4倍,Agent任务成本降至1/3
8月11日,英伟达在签署开源AI公开信后首次拿出开源模型:Nemotron 3.5 Lightning总参数300亿、每次推理仅激活约30亿,输出速度最高达同规模模型的4倍;配套开源的NeMo Switchyard路由库,把Agent执行成本砍至全部使用Claude Opus 4.8时的约1/3。
8月11日,英伟达在签署开源AI公开信后首次拿出开源模型:Nemotron 3.5 Lightning总参数300亿、每次推理仅激活约30亿,输出速度最高达同规模模型的4倍;配套开源的NeMo Switchyard路由库,把Agent执行成本砍至全部使用Claude Opus 4.8时的约1/3。
7月24日,英伟达在支持开源AI模型的联名公开信上签了名。不到三周后,它交出了自己的答卷——不是白皮书,不是路线图,而是两个可以直接下载的开源项目。
这次的出手,是双倍的。
Nemotron 3.5 Lightning——黄仁勋称之为"智能、快速、高效且开源",专为持续运行、长时间工作的Agent设计。NeMo Switchyard——一个在多模型之间按需分配任务的智能路由库,目标是把长程Agent的成本和延迟压下来。
英伟达签署支持开源AI模型的联名公开信
Nemotron 3.5 Lightning 与 NeMo Switchyard 同日开源
模型同步上架Hugging Face、ModelScope、OpenRouter及官方开发者平台
注:时间线信息综合公开报道整理。
一个模型是不是真能打,要看它站在别人的考场上表现如何。两个独立评测给出了相当一致的画面。
注:两个评测的指标不可直接互换——Artificial Analysis侧重模型本体能力与生成速度,PinchBench侧重Agent任务完成效率。
速度的账,靠的是架构。
Nemotron 3.5 Lightning采用混合专家架构:总参数300亿,但处理每个token时只激活约30亿参数——用更少的计算做更多的事,这是速度的第一层来源。
路由只调用少量专家模块,保留300亿总容量的同时,把单次推理的计算开销大幅压低。
训练中学习提前推测后续多个token,再逐项验证,减少一步步「挤牙膏」式生成。
配套DSpark、DFlash两款草稿模型快速生成候选内容,再统一校验,加速推理。
提供BF16与NVFP4双版本,可跑在RTX 5090、DGX Spark等本地硬件上。
在英伟达的规划里,它不负责复杂推理,而是做Agent的"工作模型"——承担工具调用、结果检查、格式整理、代码运行这些高频且流程相对固定的操作。复杂的规划与编排,交给Nemotron 3 Ultra这类前沿模型。
注:CrowdStrike、Harvey、CodeRabbit等公司已分别探索将其用于网络安全、法律服务和代码审查;也有团队在针对软件开发、金融、医疗场景做垂直微调。
真正把成本系统性降下来的,是第二个开源产品。
Agent执行长程任务,要经历规划、检索、工具调用、结果验证、纠错等环节。每个环节对模型能力、响应速度和成本的要求完全不同——都用最强的模型,是巨大的浪费。NeMo Switchyard就是那个分发请求的"调度中枢"。
注:Switchyard不锁死英伟达自家模型,开源与闭源模型均可接入;开发者可按准确率、速度、成本自定义路由策略。
英伟达内部测试显示:与全部任务使用Claude Opus 4.8相比,Switchyard能在保持接近其准确率的前提下,把任务完成成本降至约1/3。
第三方数据,更值得看。
这些账单指向一个事实:模型路由正在成为Agent成本结构的新变量。用对环节,省钱立竿见影;但准确率下降与任务失败的隐性成本,同样要算在账上。
开源双响炮之外,英伟达的牌桌上还有一张更大的牌。据公开报道,Nemotron 4系列正在研发中,最大版本预计至少1万亿参数,约为Nemotron 3 Ultra的两倍,目标直指全球领先开源模型的水平。但训练尚未完成,具体规格与发布时间都还没敲定。
注:条长为相对比例示意(约两倍关系),非精确参数对比;以官方最终发布为准。
英伟达为什么亲自下场做模型?两个目的:一是用模型开发反向优化芯片与软件栈;二是用高质量开源模型降低企业使用AI的门槛——越多企业做训练、微调、部署,GPU需求盘子就越大。
但这让英伟达与客户的关系变得微妙。OpenAI和Anthropic是它芯片的大买家,Reflection AI等开源模型公司又拿过英伟达的投资。自己下场做高性能模型,等于在伙伴的赛道里放了一个"自己"。
英伟达这次没有押注"一个模型打天下",而是把执行和调度拆成两个开源项目:Lightning负责便宜地干活,Switchyard负责聪明地分配。当Agent从一次性问答走向持续运行,模型路由将变成基础设施的默认层——谁能把"分配"做到最顺,谁就掌握下一代AI应用的成本曲线。真正的风险不是技术,而是英伟达越深入模型层,与自家客户的边界就越难画清。
两个开源项目均已面向开发者开放下载与调用: