Google DeepMind 发布 Gemini Robotics 2,机器人全身智能控制新突破
从指尖到脚尖,机器人第一次学会了全身协调。Google DeepMind 今日推出 Gemini Robotics 2,这是一套为机器人打造的智能层,让机器人能够行走、蹲下、伸展、精细操作,甚至与其他机器人协作完成复杂任务。这是继 Gemini Robotics 之后,机器人智能从"上半身"走向"全身"的关键一步。
从指尖到脚尖,机器人第一次学会了全身协调。Google DeepMind 今日推出 Gemini Robotics 2,这是一套为机器人打造的智能层,让机器人能够行走、蹲下、伸展、精细操作,甚至与其他机器人协作完成复杂任务。这是继 Gemini Robotics 之后,机器人智能从"上半身"走向"全身"的关键一步。
此前,机器人智能体大多只能控制上半身完成桌面任务。而现实世界是为人类动作设计的——需要弯腰、够取、在拥挤空间里保持平衡。Gemini Robotics 2 第一次将物理 AI 扩展到了全身运动。
仅上半身操作,限于桌面任务,无法移动或适应复杂空间。
全身协调控制,行走、蹲下、伸展、操作,从脚到手的完整动作链。
一个具体的例子:当控制 Apptronik 的 Apollo 2 人形机器人时,只需下达"把喷壶放进底层架的绿色箱子里"。Apollo 2 自主走到桌前、拿起喷壶、走到架子前、精准放置——全程无需人工干预。
这不是简单的"走"+"拿"+"放"的拼接,而是模型在每一个时刻对全身关节的协调控制。运动速度还有提升空间,但这是第一次让机器人真正以"完整身体"去完成真实世界任务。
注:全身控制指机器人从脚底到指尖的完整运动链参与任务执行,区别于仅使用机械臂或上半身的传统方案。
Gemini Robotics 2 不是一个单一模型,而是一套"智能层"——三个模型分工协作,覆盖从任务规划到物理执行再到离线部署的全链路。
视觉-语言-行动模型,直接控制多种机器人形态,一个模型参数支持多款机器人,包括 Apptronik Apollo 2、Franka Duo 等。
推理模型,作为机器人的"高级大脑",理解任务开始与结束,数百步决策链路中自我纠错,可追踪进度并概括关键事件。
最高效的 VLA 模型,离线运行、无网络延迟,继承"运动迁移"技术,<200 样本数小时即可适配全新机器人形态。
三个模型可以独立使用,也可以串联部署:ER 2 接收指令→规划任务→协调 VLA 执行→On-Device 保障本地实时响应。这种架构让机器人既能"思考"又能"行动",且不受网络限制。
注:VLA = Vision-Language-Action 模型,指同时处理视觉、语言和物理动作的端到端模型。
机器人进入真实世界,需要解决两个根本问题:安全可靠和快速适配。Gemini Robotics 2 在这两方面都做了针对性设计。
安全体系:多层防护
这不仅是理论框架——ER 2 模型在安全测试中的表现是"迄今最好的",能够区分安全与不安全操作,并在物理层面做出响应。
快速适应:200 样本就够了
On-Device 2 模型继承了"运动迁移"技术,仅需不到 200 个示例、数小时适配时间,即可适应全新的双臂机器人形态——即使传感器的形状、自由度和类型完全不同。这意味着一个模型可以快速部署到多种机器人硬件上,大幅降低了落地门槛。
注:以上机器人平台均在 Gemini Robotics 2 的测试中完成了跨形态适配,一套模型参数覆盖多种硬件。
Gemini Robotics 2 最本质的进步,是证明了"语言理解+物理控制"的路径可以泛化到全身协调和多机器人协作场景。但一个诚实的注脚:精细操作的成功率与人类水平仍有显著差距,运动速度也远未达到实用标准。机器人智能的下一场战役,将从"能做什么"转向"能做多好"——工程精度,才是真正的护城河。
Gemini Robotics ER 2 已在 Google AI Studio 开放体验,并可通过 Gemini Enterprise Agent Platform 获取私有预览。VLA 和 On-Device 模型面向早期合作伙伴开放。
Google AI Studio → 体验 Gemini Robotics ER 2