🤖 具身智能 · 技术路线

具身智能"原生"路线之争:蚂蚁灵波 6 款大脑模型 + 15 亿融资

WAIC 现场,蚂蚁灵波放出两张牌:一次发布 6 款大脑模型,同时启动首轮 15 亿元融资。首席科学家沈宇军的判断更直接——把数字世界的视频模型微调迁到机器人,是"阶段性的捷径",不是终局。

来源:公开报道 2026-07-22 全文约 4 分钟读完
#蚂蚁灵波 #具身智能 #VLA #具身原生
6 款 全栈大脑 2.0 一次发布
15 亿 首轮拟募资 · 年底第二轮
1 行业首个具身原生世界动作模型

⚡ 30 秒速览

  • 发了什么:全栈大脑 2.0 一次推出 6 款模型,覆盖空间智能、灵巧操作到环境反馈的全链路。
  • 关键卡位:LingBot-VA 2.0 是行业首个具身原生世界动作模型
  • 钱到账了:首轮拟募资 15 亿元,计划年底完成第二轮。
  • 路线判断:数字世界视频模型微调迁移是"阶段性捷径",不是终局。
  • 全栈逻辑:不是堆模型,是先把感知、对齐、预测、行动拆开验证,再谈融合。

01机器人大脑之争,进入深水区 WAIC 现场观察

今年 WAIC 最直观的变化,是具身智能第一次以成体系的方式出现。H3 馆内超过 200 家具身企业集中亮相,"表演型机器人"不再是主角,搬运、巡检、分拣、整理等贴近真实场景的能力展示显著增多。

决定机器人从"可看"走向"可用"的,是那个不那么直观的部分——机器人大脑。

200+WAIC 具身企业
6全栈大脑 2.0 模型
15亿首轮拟募资
2年内计划两轮融资

注:融资信息来自蚂蚁灵波官方披露;首轮募资 15 亿元,第二轮计划于年底完成。

02为什么"具身原生"值得重新讨论 一场路线之争

沈宇军提出过一个颇为直接的判断:将数字世界的视频模型通过微调迁移到机器人场景,本质上仍是一种路径依赖,更像阶段性的"捷径",而非面向物理世界的终局解法。

这一判断来自一位生成模型出身的研究者,也让"具身原生"这个概念有了更加具体的技术含义。

数字世界迁移

视频模型微调 → 机器人场景。路径依赖,短期见效,但物理世界缺失的模态无法补全。

具身原生

数据、训练目标、模型架构,都服务于机器人在物理世界中的感知与行动需求。

注:两者的核心差异不在"模型有多大",而在"需求从哪里来"。

03两条路线,各自解决了什么 VLA 与 VA 的能力边界

VLA 和 VA,目前都不是终局。它们分别解决了对齐与动态建模的问题,短板也很明显。沈宇军的选择是:两条腿走路,先把能力摸清楚。

🎯 VLA:快速响应变化 对齐能力

  • 让机器人拿杯子,还没拿到之前突然改指令——VLA 能快速切换到新任务。
  • 基于多模态模型构建,对语言理解和临时指令变化更好。
  • 对数据鲁棒性更高,不要求数据特别干净。
短板:动态建模与预测能力相对弱。

🎲 VA:容忍随机性 预测能力

  • 桌面小球案例:球最终打到哪里,无法提前预测,但 VA 能更好地处理这种随机性。
  • 源自视频生成,对非确定性场景的容忍度更高。
  • 数据利用效率更高。
短板:对数据质量要求高,语言指令跟随较弱。

🖐️ 触觉:还没到发布的时候 早期布局

  • 从去年开始布局,但两次发布都没有推出触觉模型
  • 传感器不成熟:电磁、电容、视触觉方案各有所长,但规模化生产是问题。
  • 硬件迭代有周期,传感器没到位,本质上就是数据没到位
方向确定,节奏未定。

04"原生"难在哪 从零训练模型的三个坑

讲原生是一回事,真正把原生做出来是另一回事。关键在于:有没有能力从头训练一个模型——从一堆随机数开始,最终训练成机器人的"大脑"。

复现 DINO,没那么容易

自监督训练到一定程度后继续提升,并不像论文里说的那样"跑一下代码就行"。模型规模变大后,小模型阶段看到的现象会消失;需要在 DINO 范式上加入自己的目标函数,并让规模化训练真正体现优势。

MoE 负载均衡:10 个专家只有 2 个在工作

设置 10 个专家,训练后发现只有两个在工作,其余八个基本不工作——这和两个专家的稠密模型没区别。关键在采样方式与目标函数设计,让不同专家真正实现负载均衡。

因果建模:物理世界不能"看到未来"

数字世界可以双向连接,现在看到未来;现实世界只能基于过去预测未来。单向注意力机制被训练进模型后,会牺牲部分画面生成质量,但对实时预测和行动更重要。

05物理世界的数据"新大陆" 标准未定,取舍先行

数据标准尚未收敛。模态不确定、精度要求分歧(毫米级还是厘米级?)、成本与质量如何平衡——做模型的人提不出哪五个维度最重要,做数据的人只能把所有指标都向前推进,成本随之急剧上升。

但真实数据里,也有优先级。

真机遥操作

质量要求极高,难以绕开。机器人必须熟悉自己的身体,这类数据体量不需要很大。

真实无本体

代表人类最真实的行为方式,比真机数据更容易上量。第一人称设备、夹爪采集都在此列。

互联网数据

体量大、蕴含知识,但向物理世界迁移时部分模态无法补全,只能作为打底。

注:仿真数据在蚂蚁灵波的框架里不是通用解——为每一类任务构建仿真环境,过于沉重。

沈宇军对"具身智能的 ChatGPT 时刻"另有定义:普通人能以低成本方式参与机器人数据生产——像特斯拉车主日常驾驶帮采集数据那样。"那可能才是我心目中的具身智能 ChatGPT 时刻。"

06安全:不能只靠"围栏" 原生安全

现在大部分机器人安全方案仍是围栏式:告诉机器人不能做什么。但现实中的危险无法穷举——倒水本身没问题,可旁边有插座呢?

沈宇军的判断是:安全应该是一种预训练阶段就植入的本能,而不是运行时查规则。这比让机器人做一顿饭更高阶。

07编辑判断

编辑核心判断

具身智能的终局,不是 VLA 与 VA 谁赢,而是谁有能力从物理世界的需求出发,把模型从头训练出来。路线会收敛,能力会沉淀,时间会给答案。

资本入场

蚂蚁灵波已启动融资,首轮拟募资 15 亿元,计划年底完成第二轮。

全栈大脑 2.0 的技术路线,将迎来更公开的行业检验。