🤖 具身智能 · 路线观察

拒绝“数字智能嫁接”:蚂蚁灵波下场自研“具身原生”大模型,用 6 万小时真实数据攻坚机器人大脑

蚂蚁集团旗下的具身智能公司蚂蚁灵波宣布启动首轮融资。在 2026 外滩大会上,其管理层明确表达技术主张:具身智能不是数字智能的嫁接,必须基于物理真实数据。其发布的原生具身模型已全面开源。

来源:综合公开信息整理 2026-09 约 3 分钟阅读
#蚂蚁灵波 #具身智能 #具身原生 #机器人大模型 #开源模型
150Hz LingBot-VA 2.0 单卡实时推理效率
<130ms LingBot-VLA 2.0 在 4090 上推理耗时
90%+ 物理数据训练可用率(此前为15%)
TLDR / 速览

⚡ 蚂蚁灵波技术路线与战略要点

  • 摒弃传统嫁接路线:拒绝将视觉语言模型(VLA)或视频生成模型(WAM)强行微调控制机器人,坚持从零预训练“具身原生”基模。
  • 重磅发布全栈大脑 2.0:推出自回归架构动作模型 LingBot-VA 2.0 与融入 6 万小时真实物理数据的 LingBot-VLA 2.0,模型全量开源。
  • 打破数据堆量迷思:重构数据采集与过滤链路,将原始数据进入模型训练的可用率从 15% 提升至 90% 以上
  • 明确商业边界:定位“只做大脑、不做本体”,聚焦生活服务(如智慧药房,单次取药<3分钟)与工业上下料场景。

01路线之争 为什么拒绝“数字智能嫁接”?

当前具身智能领域存在主流的 VLA(视觉语言延伸)与 WAM(视频生成搬运)两条路线。蚂蚁灵波管理层认为,这两种路线都是“在已有工具之下解机器人问题想出来的名词”,本质上过于想走捷径。

“拿数字模型控机器人,就像非要求男人生孩子。”

传统微调路线(如微调Wan模型)

数字模型存在能力上限;过度微调会破坏原模型的先验与知识,导致泛化性显著降低,极易撞到性能“南墙”。

具身原生路线(LingBot 2.0)

不依赖数字世界基模,基于自回归架构从头预训练,将空间、力觉与视觉动作分词器原生融合。

“非要让一个数字世界模型去控机器人,特别像非要求一个男人生孩子。”

—— 朱兴,蚂蚁灵波 CEO

在灵波的技术框架中,机器人被抽象为三件事:提取空间与力的 token、模态信息融合对齐、输出可执行动作。感知并理解物理世界的力与空间,是数字大模型从未触及的领域,也是具身智能的真正起点。

02全栈大脑 2.0 参数细节与物理数据

灵波发布的 LingBot-VA 2.0 是业界首个具身原生世界动作模型。它组合了语义视觉动作分词器、严格因果预训练、MoE 架构与异步推理,实现了极高的实时响应能力。

6万小时真实物理数据
17家覆盖机器人厂商
20种适配机器人构型
29.8K公开仓库 Stars 积累
数据说明:上述推理耗时(RTX 4090 显卡下 130 毫秒以内)及单卡 150Hz 实时推理效率均引自企业发布会与公开技术文档,实际效果受具体物理硬件部署环境影响。

支撑该路线的技术底座 LingBot-VLA 2.0 已全部开源,不仅获得了开源社区的广泛关注,也被多家金融机构研报与国际技术论坛列为重点开源 AI 项目。

03重塑数据漏斗 质与分布胜于盲目“堆量”

在蚂蚁灵波看来,具身智能的核心壁垒不是模型架构的微创新,而是真实物理数据的分布与质量。行业普遍讨论的“千万小时”数据量本身缺乏实际意义,关键在于能否拿到高价值的 corner case。

数据高效利用流式 pipeline:
01 模型研发反向定义数据类型、分布与场景任务 按需定制
02 高难度场景先行试采,沉淀 SOP 后推给供应商 流式交付
03 优化清洗与特征提取,拉升数据转化效率 可用率 15% ➔ 90%+

灵波将数据团队提升为研发的核心 knowhow 部门,由具备十年自动驾驶背景的团队领衔,重点突破物理数据从采集到进入模型训练的转化效率。

04落地试验场与战略边界

在商业化思路上,灵波主张“哪怕打童工,也该干活了”,但对落地场景设定了严格的三个约束条件:环境不能太开放、任务不能太长程、成本必须能算过账。

🏥 智慧药房真实场景落地(国大药房试验场)实测进行中

  • 0 货架改造:在不改造现有药房货架的前提下直接投入使用。
  • 闭环流程:自主完成接单、导航、识别药品、抓取并送回全流程,平均单次取药耗时低于 3 分钟
  • 复杂 SKU 覆盖:覆盖超过 150 种常见药品,有效分担夜间单人值守时的找药取药高频劳动。
场景定位:2B2C 试验场,作为机器人最终进入家庭生活服务领域的前哨站。
边界极度清晰:只做大脑,不出货硬件本体

灵波明确表态,公司不建大规模数据采集产能,不做本体量产,也不控制供应链成本。核心输出模式为闭环基模 + 工具链,本体出货交由合作厂商(如乐聚机器人),合作伙伴反向回流数据,形成协同生态。

EDITORIAL JUDGMENT / 编辑核心判断

具身智能不应是数字大模型的附庸。试图通过微调文生视频或多模态大模型来操纵机器人,短期内虽能快速出 Demo,长期看必将遭遇泛化性崩溃与算力壁垒。

然而,选择“原生自训”意味着极其高昂的数据获取与试错成本。在机器人大脑赛道逐步向少数几家收敛的过程中,蚂蚁灵波能否凭“只做大脑、不做本体”的克制生态策略,在商业落地的真实产出中穿越数据冷启动的高墙,仍需市场与实景规模化验证。