Gemini Robotics 2 发布:机器人首次实现全身智能控制,多机协作完成复杂任务
Google DeepMind 今日推出 Gemini Robotics 2,一套为机器人打造的通用智能层。从足尖到指尖,机器人首次获得全身协调控制能力,可自主完成整理房间、精密操作等复杂任务,并支持多机器人协作与本地离线运行。
Google DeepMind 今日推出 Gemini Robotics 2,一套为机器人打造的通用智能层。从足尖到指尖,机器人首次获得全身协调控制能力,可自主完成整理房间、精密操作等复杂任务,并支持多机器人协作与本地离线运行。
Gemini Robotics 2 并非单一模型,而是由三款高度专业化模型组成的智能层,分别负责物理执行、任务规划与离线部署:
视觉-语言-动作(VLA)模型,直接控制机器人全身运动与精细操作。
执行层推理模型,负责拆解任务、规划步骤、与人交互、自我纠错。
规划层最轻量 VLA,专为本地离线运行设计,无网络延迟,适配新形态仅需几小时。
本地层三模型协同工作:ER 2 作为"大脑"理解指令并规划步骤,VLA 作为"身体"执行动作,On-Device 2 确保在无网络环境下也能稳定运行。这种分层架构让机器人既能思考,也能行动,还能离线工作。
注:三种模型共享同一基础能力,但针对不同场景做了专门优化。VLA 模型已可在 Google AI Studio 体验,ER 2 通过 Gemini Enterprise Agent Platform 提供私有预览。
过去的机器人模型大多只控制上半身,完成桌面级任务。Gemini Robotics 2 将控制范围扩展至全身——走路、弯腰、蹲下、伸手、转身,所有动作由同一模型统一协调。
一个典型的例子:控制 Apptronik Apollo 2 人形机器人执行指令——"把浇水壶放到底层架子的绿色箱子里"。Apollo 2 自主走到桌前,捡起浇水壶,走了几步到架子前,精准放入目标位置。整个过程涉及行走、抓取、定位、放置等多个子任务,过去需要分别编程,现在由模型端到端完成。
一个诚实的注脚:机器人的移动速度仍有提升空间,但这是首次在真实场景中验证全身协调控制的能力闭环。
预编程或远程操作,只能执行固定、重复的任务序列,无法适应环境变化。
端到端学习,同一模型控制全身,可自主适应不确定环境,任务完成率中到高。
要在人类环境中真正有用,机器人需要灵巧度。Gemini Robotics 2 支持从简单到复杂的多种末端执行器:
在 SharpaWave 五指手上,模型完成了打结、密封拉链袋等精细动作。在 Franka Duo 双机械臂平台上,使用标准两指夹爪完成了紧密包装等复杂任务。同一模型权重,无需修改即可切换到不同硬件。
注:多手指精细操作(如打结、穿针)的成功率目前仍低于全身控制任务,是持续攻关的方向。精度和速度正在向人类水平逼近。
多手指精细操作仍具挑战——这是当前技术路线最诚实的边界。
Gemini Robotics 2 首次引入多机器人协作能力。不同类型、不同形态的机器人可以实时通信,分工完成单一机器人无法独立完成的复杂工作流。
例如,一个人形机器人负责搬运重物,另一个协作臂机器人负责精细组装,第三个移动平台负责物料中转——三台机器人在同一任务框架下自主协调,无需人工干预。
这种协作能力的关键在于 Gemini Robotics ER 2 的推理层:它观察环境、拆解任务、分配子任务给不同机器人,并持续跟踪进度。如果某个步骤失败,模型能自主纠错或请求人类介入。
注:多机器人协作目前适用于结构化场景,复杂动态环境下的实时协调仍在持续迭代中。
随着机器人能力增强,安全成为最核心的课题。DeepMind 推出 ASIMOV-Agentic 基准,专门评测机器人智能体在不确定环境中的安全决策能力:
静态规则检查,无法覆盖动态交互场景,缺乏对不确定性的处理。
评测机器人拒绝不安全工具调用、预测任务可行性、主动请求人类介入的能力。
Gemini Robotics ER 2 在安全约束遵循和人类接近检测基准上,达到所有 DeepMind 机器人模型中最优水平。当检测到人类靠近时,模型能自动触发安全工具调用,使机器人安全停止——这是协作安全标准的关键要求。
注:安全技术报告已同步发布,详细说明了多层级安全框架的设计与验证方法。
Gemini Robotics 2 的真正价值,不在于单项指标的提升,而在于它第一次把"全身控制""精细操作""多机协作""本地运行"这四件事放在同一个智能框架里解决。过去的机器人系统往往只能做好其中一两项。
但也要看到边界:多手指精细操作的成功率仍不理想,移动速度远未达到人类水平。从实验室到家庭和工厂,中间还有很长的工程化距离。
一个诚实的观察:Gemini Robotics 2 证明了"模型架构 + 系统工程"的协同效应正在超越单纯的参数竞赛,但物理世界的通用智能仍需跨越硬件、成本、安全三座大山。
机器人领域的竞赛正在从"单任务自动化"转向"通用智能体"——谁先打通执行、推理、协作、安全的全链路,谁就真正掌握了物理世界的入口。
Gemini Robotics ER 2 已上线 Google AI Studio,VLA 和 On-Device 模型面向早期合作伙伴开放。开发者可通过官方渠道申请接入。
ai.google.dev → 申请体验* 当前为早期合作伙伴阶段,公开使用入口将逐步开放