Gemini Robotics 2 发布:三模型协同实现全身智能控制,机器人迈入"可适应"新阶段
7 月 30 日,Google DeepMind 发布 Gemini Robotics 2,这是首个实现人形机器人全身智能控制的 VLA 模型系列——从脚到指尖的完整控制,数小时内适配全新机器人本体,并支持多机器人协作。
7 月 30 日,Google DeepMind 发布 Gemini Robotics 2,这是首个实现人形机器人全身智能控制的 VLA 模型系列——从脚到指尖的完整控制,数小时内适配全新机器人本体,并支持多机器人协作。
大多数机器人仍是预先编程或远程操控的,只能执行狭窄、重复的任务序列。它们缺乏真正的自主学习和适应能力。Google DeepMind 的解法是:为机器人搭载多个 AI 模型,各司其职。
视觉+语言→马达控制,实现从脚到指尖的完整人形机器人控制,大幅提升双手与夹爪的灵巧操作能力。
全身控制 灵巧操作机器人的"大脑 Agent",与人类沟通、理解物理世界,规划数分钟的多步骤任务,支持多机器人团队协作。
任务规划 多机协作专为设备本地运行设计,无需网络。继承运动迁移技术,数小时(<200 个示例)即可适应全新双臂机器人本体。
离线运行 快速适配注:三个模型可独立或协同工作。VLA 模型负责"动作执行",ER 2 负责"思考决策",On-Device 2 负责"本地化适配"。实际部署时可根据任务需求组合使用。
Google DeepMind 公开了多段完全自主的机器人演示视频,并附带了详细的成功率评估数据。以下三个案例覆盖了从全身控制到精细操作的不同维度。
注:所有演示视频均为"完全自主"机器人的实时录像,与业界某些使用远程操作员的演示形成对比。成功率数据来自 Google DeepMind 内部评估报告。
一个关键事实:谷歌做的是软件层,不是机器人本体。Gemini Robotics 2 可以运行在多种机器人硬件上,包括 Apptronik 的 Apollo 2 人形机器人、Franka 的机械臂等。
这与传统机器人公司的路径截然不同。大多数厂商从硬件出发,再为硬件适配软件。谷歌的答案是:先打造通用的机器人智能层,再适配不同硬件。
预先编程或远程操控,只能执行狭窄、重复的任务序列。技能迁移困难,每个新任务都需要重新编程。
AI 模型驱动,自主理解环境并规划动作。技能可跨本体迁移,数小时适应新硬件,支持多机器人协作。
Gemini Robotics 2 的架构继承自 Gemini 1.5 系列,并在运动迁移、多模态理解、安全推理三个方向上做了关键升级。从技术演进看,搜索引擎时期的意图理解能力,被迁移到了物理世界的动作理解中——这是谷歌二十余年 AI 积累的"溢出"效应。
"安全问题更加紧迫,因为你要让它们面对大量不同的场景,会出现很多不确定性。"Google DeepMind 团队负责人 Carolina Parada 表示。Gemini Robotics 2 在安全方面做了三个关键升级。
新推出的 ASIMOV-Agentic 基准,专门衡量具身推理智能体在安全方面的表现:能否拒绝 VLA 发出的不安全工具调用请求?能否在任务不确定时主动请求人工干预?
在安全约束遵循和人类接近度基准上,Gemini Robotics ER 2 是迄今为止最安全的机器人模型。当有人靠近时,它能成功停止人形机器人,并在区域无人后自主恢复工作——这是协作安全标准中的关键要求。
注:安全评估采用"传统物理安全措施 + AI 安全框架"的多层次方法。ASIMOV-Agentic 基准已开源,社区可复现。
Gemini Robotics 2 证明:机器人能力的上限,不再由硬件决定,而是由智能软件定义。当"学习"取代"编程",硬件差距可以被软件快速抹平——这是一条正在被跨越的分水岭。
Gemini Robotics ER 2 已在 Google AI Studio 开放,支持开发者直接体验具身推理能力。
VLA 模型与本地端模型面向早期合作伙伴开放,可通过 Gemini Enterprise Agent Platform 申请。