🧠 世界模型 · 技术发布

英伟达 Cosmos 3 发布:全球首个全模态世界基础模型,要做具身智能时代的「安卓系统」

7 月悉尼 RSS 2026 上,英伟达发布 Cosmos 3——全球首个在单一 Transformer 架构下打通文本、视觉、音频、动作四模态的世界基础模型,同步推出 Edge / Nano / Super 三档规格,并全量开源。具身智能正式从「组装机时代」迈入「整机一体化时代」。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#英伟达 #Cosmos3 #世界基础模型 #具身智能 #RSS2026
4 模态 文本·视觉·音频·动作 统一架构
3 档 Edge 4B / Nano 16B / Super 64B
100% 开源 模型权重 · 代码 · 论文全量公开

⚡ 30 秒速览

  • 打通四模态:文本、图像/视频、音频、动作在单一 Transformer 下统一建模,全球首个全模态世界基础模型,可理解、可模拟、可执行。
  • 三档覆盖全场景:Edge 4B 端侧实时推理(Jetson 可跑)→ Nano 16B 均衡之选 → Super 64B 云端满血,按需选择。
  • 全量开源,作者亲自维护:模型权重、代码、论文全公开,英伟达物理 AI 专家 Max Li 承诺手动回复所有 GitHub Issues。
  • 训练规模:推理器 2200 万样本 + 生成器 220 万样本,视频预训练数据折合约 1000 万小时,超 100 人参与研发。
  • 战略野心:英伟达正从硬件垄断者转向标准定义者——让全球碎片化的机器人形态在 Cosmos 的逻辑底座上统一进化。

01它能做什么?理解世界 · 模拟未来 · 执行动作

一个合格的世界基础模型,必须同时具备三种能力。Cosmos 3 将它们整合进单一模型,不再需要拼凑多个独立系统。

🧠 理解世界 VLM 级推理

  • 给定一段机器人执行任务的观测视频,模型可像 VLM 一样推理:从什么时间到什么时间发生了什么,对环境状态进行结构化描述。
  • 识别物体、场景、时序关系、空间布局——理解是行动的前提。
核心价值:没有理解,就无法采取有意义的行动。

🌐 模拟未来 零成本试错

  • 预测执行特定动作后的结果——在真实世界中打破一个玻璃杯是不可逆的,但在仿真环境中可以反复打破,成本为零
  • 支持第一人称视角模拟,联合建模音频(碰撞、摩擦等物理线索),让模拟更逼近真实。
核心价值:降低真实世界试错成本,加速策略迭代。

🤖 执行动作 策略模型直出

  • 当模型对状态及其转移机制的建模足够深刻,它自然就具备了策略能力——接收指令,在现实世界中执行
  • 支持多种具身形态:单臂机器人、双臂机器人、人形机器人、自动驾驶车辆、第一人称相机运动等。
核心价值:从感知到行动的闭环,真正实现「在物理世界中干活」。

一个模型,三种能力——这不是三个独立模块的拼接,而是同一套参数在输入输出端的灵活配置。

02技术突破:从「组装机」到「整机一体化」

过去两年的具身智能,开发者需要将视觉模型、语言模型和控制算法像乐高一样拼凑在一起。Cosmos 3 的出现,宣告了这种「组装机时代」的终结。

组装机时代

各模态独立建模:视觉模型看、语言模型想、控制算法动——拼接成本高,模态间信息损耗大,协同困难。

整机一体化时代

单一 Transformer 架构,MoE 混合专家设计,推理器 + 生成器协同,文本/图像/视频/音频/动作全部打通。

2200万推理器训练样本
220万生成器训练样本
~1000万小时视频预训练数据
100+人参与研发

注:训练分三个阶段——预训练(图像/视频生成)→ 中期训练(引入动作与跨域数据)→ 后期训练(策略模型微调)。数据规模随模型规格动态调整。

架构层面,Cosmos 3 采用 MoE(混合专家)设计,分为推理器(Reasoner)和生成器(Generator)两部分。推理时使用因果自注意力,生成时切换为双向注意力,确保理解与生成各取所长。

一个关键细节:不同模态的时间对齐。语言 Token 没有时间概念,但视频、音频和动作必须精确同步。Cosmos 3 以 24 FPS 为基准线,将所有输入重新计算索引,让内容在真实时间轴上对齐。

03模型矩阵:Edge · Nano · Super 按需取用,从端侧到云端

不同场景对算力和实时性的要求天差地别。Cosmos 3 提供了三档规格,覆盖从边缘设备到数据中心的全谱系需求。

Cosmos Edge端侧实时
4B
Cosmos Nano均衡之选
16B
Cosmos Super云端满血
64B

注:柱形宽度示意参数量相对比例,非精确线性缩放。Edge 为 4B MoE(2 个专家塔各 2B),Nano 为 16B MoE(推理器+生成器各 8B),Super 为 64B MoE(各 32B)。

Edge 版的特殊之处:砍掉了音频模态以节省资源,可在 Jetson 等边缘设备上实现实时推理,不再需要服务器级 GPU。这对广大机器人开发者来说,是真正的「降门槛」——机器人不再需要背着服务器跑。

一个诚实的注脚:更大模型在图像和视频生成上有着极其明显的优势。Scaling Law 依然成立,但端侧部署的实时性需求同样不可忽视。

04为什么是英伟达?从硬件垄断到标准定义

答案藏在英伟达过去二十年的积累里:它不仅是算力提供商,更是最早将「物理模拟」作为核心战略的公司之一。从 GPU 芯片到 CUDA 生态,从 Omniverse 到 Jetson,英伟达一直在构建一个完整的「芯片 → 框架 → 模型 → 部署」全栈链路。

Cosmos 3 的出现,让这条链路在具身智能领域实现了闭环:

GPU 算力 世界基础模型 边缘端推理 机器人落地

但更深层的野心在于「定义标准」。英伟达正在通过 Cosmos 3 建立一套标准化的「大脑与肢体」协议——让全球碎片化的机器人形态(单臂、双臂、人形、轮式、飞行器),都能在 Cosmos 的逻辑底座上实现统一进化。这就像安卓系统对手机行业的重塑:硬件百花齐放,但底层操作系统统一

开源是这一战略的关键落子。Cosmos 3 的模型权重、代码、论文全量公开,英伟达物理 AI 专家 Max Li 在演讲中承诺:「我会手动回复 GitHub 上的所有 Issue,没有用任何 AI Agent,真的是我本人。」——这种姿态,与其说是技术分享,不如说是社区培育。

编辑核心判断

具身智能的下半场,比拼的不再是单点模型能力,而是从芯片到框架到生态的全栈定义权。英伟达正试图用「全模态统一架构 + 全栈链路覆盖 + 全量开源」的组合拳,让 Cosmos 3 成为物理世界的标准操作系统——如果成功,它将成为具身智能时代的「安卓」,而不仅仅是「英伟达的一个模型」。

获取 Cosmos 3

模型权重、代码与论文已全量开源,前往 GitHub 项目主页即可获取。

项目地址:github.com/NVIDIA/Cosmos3

Edge 版可在 Jetson 设备上实时运行,Nano 与 Super 版需服务器级 GPU