英伟达 Cosmos 3 发布:全球首个全模态世界基础模型,要做具身智能时代的「安卓系统」
7 月悉尼 RSS 2026 上,英伟达发布 Cosmos 3——全球首个在单一 Transformer 架构下打通文本、视觉、音频、动作四模态的世界基础模型,同步推出 Edge / Nano / Super 三档规格,并全量开源。具身智能正式从「组装机时代」迈入「整机一体化时代」。
7 月悉尼 RSS 2026 上,英伟达发布 Cosmos 3——全球首个在单一 Transformer 架构下打通文本、视觉、音频、动作四模态的世界基础模型,同步推出 Edge / Nano / Super 三档规格,并全量开源。具身智能正式从「组装机时代」迈入「整机一体化时代」。
一个合格的世界基础模型,必须同时具备三种能力。Cosmos 3 将它们整合进单一模型,不再需要拼凑多个独立系统。
一个模型,三种能力——这不是三个独立模块的拼接,而是同一套参数在输入输出端的灵活配置。
过去两年的具身智能,开发者需要将视觉模型、语言模型和控制算法像乐高一样拼凑在一起。Cosmos 3 的出现,宣告了这种「组装机时代」的终结。
各模态独立建模:视觉模型看、语言模型想、控制算法动——拼接成本高,模态间信息损耗大,协同困难。
单一 Transformer 架构,MoE 混合专家设计,推理器 + 生成器协同,文本/图像/视频/音频/动作全部打通。
注:训练分三个阶段——预训练(图像/视频生成)→ 中期训练(引入动作与跨域数据)→ 后期训练(策略模型微调)。数据规模随模型规格动态调整。
架构层面,Cosmos 3 采用 MoE(混合专家)设计,分为推理器(Reasoner)和生成器(Generator)两部分。推理时使用因果自注意力,生成时切换为双向注意力,确保理解与生成各取所长。
一个关键细节:不同模态的时间对齐。语言 Token 没有时间概念,但视频、音频和动作必须精确同步。Cosmos 3 以 24 FPS 为基准线,将所有输入重新计算索引,让内容在真实时间轴上对齐。
不同场景对算力和实时性的要求天差地别。Cosmos 3 提供了三档规格,覆盖从边缘设备到数据中心的全谱系需求。
注:柱形宽度示意参数量相对比例,非精确线性缩放。Edge 为 4B MoE(2 个专家塔各 2B),Nano 为 16B MoE(推理器+生成器各 8B),Super 为 64B MoE(各 32B)。
Edge 版的特殊之处:砍掉了音频模态以节省资源,可在 Jetson 等边缘设备上实现实时推理,不再需要服务器级 GPU。这对广大机器人开发者来说,是真正的「降门槛」——机器人不再需要背着服务器跑。
一个诚实的注脚:更大模型在图像和视频生成上有着极其明显的优势。Scaling Law 依然成立,但端侧部署的实时性需求同样不可忽视。
答案藏在英伟达过去二十年的积累里:它不仅是算力提供商,更是最早将「物理模拟」作为核心战略的公司之一。从 GPU 芯片到 CUDA 生态,从 Omniverse 到 Jetson,英伟达一直在构建一个完整的「芯片 → 框架 → 模型 → 部署」全栈链路。
Cosmos 3 的出现,让这条链路在具身智能领域实现了闭环:
但更深层的野心在于「定义标准」。英伟达正在通过 Cosmos 3 建立一套标准化的「大脑与肢体」协议——让全球碎片化的机器人形态(单臂、双臂、人形、轮式、飞行器),都能在 Cosmos 的逻辑底座上实现统一进化。这就像安卓系统对手机行业的重塑:硬件百花齐放,但底层操作系统统一。
开源是这一战略的关键落子。Cosmos 3 的模型权重、代码、论文全量公开,英伟达物理 AI 专家 Max Li 在演讲中承诺:「我会手动回复 GitHub 上的所有 Issue,没有用任何 AI Agent,真的是我本人。」——这种姿态,与其说是技术分享,不如说是社区培育。
具身智能的下半场,比拼的不再是单点模型能力,而是从芯片到框架到生态的全栈定义权。英伟达正试图用「全模态统一架构 + 全栈链路覆盖 + 全量开源」的组合拳,让 Cosmos 3 成为物理世界的标准操作系统——如果成功,它将成为具身智能时代的「安卓」,而不仅仅是「英伟达的一个模型」。
模型权重、代码与论文已全量开源,前往 GitHub 项目主页即可获取。
Edge 版可在 Jetson 设备上实时运行,Nano 与 Super 版需服务器级 GPU