具身智能"原生"路线之争:蚂蚁灵波 6 款大脑模型 + 15 亿融资
WAIC 现场,蚂蚁灵波放出两张牌:一次发布 6 款大脑模型,同时启动首轮 15 亿元融资。首席科学家沈宇军的判断更直接——把数字世界的视频模型微调迁到机器人,是"阶段性的捷径",不是终局。
WAIC 现场,蚂蚁灵波放出两张牌:一次发布 6 款大脑模型,同时启动首轮 15 亿元融资。首席科学家沈宇军的判断更直接——把数字世界的视频模型微调迁到机器人,是"阶段性的捷径",不是终局。
今年 WAIC 最直观的变化,是具身智能第一次以成体系的方式出现。H3 馆内超过 200 家具身企业集中亮相,"表演型机器人"不再是主角,搬运、巡检、分拣、整理等贴近真实场景的能力展示显著增多。
决定机器人从"可看"走向"可用"的,是那个不那么直观的部分——机器人大脑。
注:融资信息来自蚂蚁灵波官方披露;首轮募资 15 亿元,第二轮计划于年底完成。
沈宇军提出过一个颇为直接的判断:将数字世界的视频模型通过微调迁移到机器人场景,本质上仍是一种路径依赖,更像阶段性的"捷径",而非面向物理世界的终局解法。
这一判断来自一位生成模型出身的研究者,也让"具身原生"这个概念有了更加具体的技术含义。
视频模型微调 → 机器人场景。路径依赖,短期见效,但物理世界缺失的模态无法补全。
数据、训练目标、模型架构,都服务于机器人在物理世界中的感知与行动需求。
注:两者的核心差异不在"模型有多大",而在"需求从哪里来"。
VLA 和 VA,目前都不是终局。它们分别解决了对齐与动态建模的问题,短板也很明显。沈宇军的选择是:两条腿走路,先把能力摸清楚。
讲原生是一回事,真正把原生做出来是另一回事。关键在于:有没有能力从头训练一个模型——从一堆随机数开始,最终训练成机器人的"大脑"。
自监督训练到一定程度后继续提升,并不像论文里说的那样"跑一下代码就行"。模型规模变大后,小模型阶段看到的现象会消失;需要在 DINO 范式上加入自己的目标函数,并让规模化训练真正体现优势。
设置 10 个专家,训练后发现只有两个在工作,其余八个基本不工作——这和两个专家的稠密模型没区别。关键在采样方式与目标函数设计,让不同专家真正实现负载均衡。
数字世界可以双向连接,现在看到未来;现实世界只能基于过去预测未来。单向注意力机制被训练进模型后,会牺牲部分画面生成质量,但对实时预测和行动更重要。
数据标准尚未收敛。模态不确定、精度要求分歧(毫米级还是厘米级?)、成本与质量如何平衡——做模型的人提不出哪五个维度最重要,做数据的人只能把所有指标都向前推进,成本随之急剧上升。
但真实数据里,也有优先级。
质量要求极高,难以绕开。机器人必须熟悉自己的身体,这类数据体量不需要很大。
代表人类最真实的行为方式,比真机数据更容易上量。第一人称设备、夹爪采集都在此列。
体量大、蕴含知识,但向物理世界迁移时部分模态无法补全,只能作为打底。
注:仿真数据在蚂蚁灵波的框架里不是通用解——为每一类任务构建仿真环境,过于沉重。
沈宇军对"具身智能的 ChatGPT 时刻"另有定义:普通人能以低成本方式参与机器人数据生产——像特斯拉车主日常驾驶帮采集数据那样。"那可能才是我心目中的具身智能 ChatGPT 时刻。"
现在大部分机器人安全方案仍是围栏式:告诉机器人不能做什么。但现实中的危险无法穷举——倒水本身没问题,可旁边有插座呢?
沈宇军的判断是:安全应该是一种预训练阶段就植入的本能,而不是运行时查规则。这比让机器人做一顿饭更高阶。
具身智能的终局,不是 VLA 与 VA 谁赢,而是谁有能力从物理世界的需求出发,把模型从头训练出来。路线会收敛,能力会沉淀,时间会给答案。
蚂蚁灵波已启动融资,首轮拟募资 15 亿元,计划年底完成第二轮。
全栈大脑 2.0 的技术路线,将迎来更公开的行业检验。