拒绝“数字智能嫁接”:蚂蚁灵波下场自研“具身原生”大模型,用 6 万小时真实数据攻坚机器人大脑
蚂蚁集团旗下的具身智能公司蚂蚁灵波宣布启动首轮融资。在 2026 外滩大会上,其管理层明确表达技术主张:具身智能不是数字智能的嫁接,必须基于物理真实数据。其发布的原生具身模型已全面开源。
蚂蚁集团旗下的具身智能公司蚂蚁灵波宣布启动首轮融资。在 2026 外滩大会上,其管理层明确表达技术主张:具身智能不是数字智能的嫁接,必须基于物理真实数据。其发布的原生具身模型已全面开源。
当前具身智能领域存在主流的 VLA(视觉语言延伸)与 WAM(视频生成搬运)两条路线。蚂蚁灵波管理层认为,这两种路线都是“在已有工具之下解机器人问题想出来的名词”,本质上过于想走捷径。
数字模型存在能力上限;过度微调会破坏原模型的先验与知识,导致泛化性显著降低,极易撞到性能“南墙”。
不依赖数字世界基模,基于自回归架构从头预训练,将空间、力觉与视觉动作分词器原生融合。
“非要让一个数字世界模型去控机器人,特别像非要求一个男人生孩子。”
在灵波的技术框架中,机器人被抽象为三件事:提取空间与力的 token、模态信息融合对齐、输出可执行动作。感知并理解物理世界的力与空间,是数字大模型从未触及的领域,也是具身智能的真正起点。
灵波发布的 LingBot-VA 2.0 是业界首个具身原生世界动作模型。它组合了语义视觉动作分词器、严格因果预训练、MoE 架构与异步推理,实现了极高的实时响应能力。
支撑该路线的技术底座 LingBot-VLA 2.0 已全部开源,不仅获得了开源社区的广泛关注,也被多家金融机构研报与国际技术论坛列为重点开源 AI 项目。
在蚂蚁灵波看来,具身智能的核心壁垒不是模型架构的微创新,而是真实物理数据的分布与质量。行业普遍讨论的“千万小时”数据量本身缺乏实际意义,关键在于能否拿到高价值的 corner case。
灵波将数据团队提升为研发的核心 knowhow 部门,由具备十年自动驾驶背景的团队领衔,重点突破物理数据从采集到进入模型训练的转化效率。
在商业化思路上,灵波主张“哪怕打童工,也该干活了”,但对落地场景设定了严格的三个约束条件:环境不能太开放、任务不能太长程、成本必须能算过账。
灵波明确表态,公司不建大规模数据采集产能,不做本体量产,也不控制供应链成本。核心输出模式为闭环基模 + 工具链,本体出货交由合作厂商(如乐聚机器人),合作伙伴反向回流数据,形成协同生态。
具身智能不应是数字大模型的附庸。试图通过微调文生视频或多模态大模型来操纵机器人,短期内虽能快速出 Demo,长期看必将遭遇泛化性崩溃与算力壁垒。
然而,选择“原生自训”意味着极其高昂的数据获取与试错成本。在机器人大脑赛道逐步向少数几家收敛的过程中,蚂蚁灵波能否凭“只做大脑、不做本体”的克制生态策略,在商业落地的真实产出中穿越数据冷启动的高墙,仍需市场与实景规模化验证。