🤖 机器人 · 技术突破

Gemini Robotics 2 发布:机器人首次实现全身智能控制,多机协作完成复杂任务

Google DeepMind 今日推出 Gemini Robotics 2,一套为机器人打造的通用智能层。从足尖到指尖,机器人首次获得全身协调控制能力,可自主完成整理房间、精密操作等复杂任务,并支持多机器人协作本地离线运行

来源:综合公开信息整理 2026-07-22 全文约 4 分钟读完
#Gemini Robotics 2 #机器人全身控制 #多机器人协作 #VLA 模型 #ASIMOV-Agentic
3 大模型 VLA + 推理 + 本地,覆盖全场景
22 自由度 五指灵巧手,精细操作新高度
3 机器人形态,同一模型控制

⚡ 30 秒速览

  • 核心突破:机器人首次实现全身智能控制——从走路、蹲下、伸手到精细操作,整套动作由同一模型驱动。
  • 三个模型各司其职:Gemini Robotics 2(VLA 执行)、Gemini Robotics ER 2(推理规划)、Gemini Robotics On-Device 2(本地离线运行)。
  • 多机协作:不同类型机器人可实时通信、分工合作,完成单机无法完成的复杂工作流。
  • 快速适应:新机器人形态只需 200 个示例、几小时即可完成模型适配,无需重新训练。
  • 安全升级:全新 ASIMOV-Agentic 基准,机器人能拒绝不安全指令、感知人类接近并主动停止。
  • 诚实注脚:多手指精细操作仍具挑战,速度和精度尚未达到人类水平。

01三大模型,一套智能 覆盖执行、推理与本地运行

Gemini Robotics 2 并非单一模型,而是由三款高度专业化模型组成的智能层,分别负责物理执行、任务规划与离线部署:

Gemini Robotics 2

视觉-语言-动作(VLA)模型,直接控制机器人全身运动与精细操作。

执行层

Gemini Robotics ER 2

推理模型,负责拆解任务、规划步骤、与人交互、自我纠错。

规划层

Gemini Robotics On-Device 2

最轻量 VLA,专为本地离线运行设计,无网络延迟,适配新形态仅需几小时。

本地层

三模型协同工作:ER 2 作为"大脑"理解指令并规划步骤,VLA 作为"身体"执行动作,On-Device 2 确保在无网络环境下也能稳定运行。这种分层架构让机器人既能思考,也能行动,还能离线工作

注:三种模型共享同一基础能力,但针对不同场景做了专门优化。VLA 模型已可在 Google AI Studio 体验,ER 2 通过 Gemini Enterprise Agent Platform 提供私有预览。

02从足尖到指尖:全身智能控制首次落地

过去的机器人模型大多只控制上半身,完成桌面级任务。Gemini Robotics 2 将控制范围扩展至全身——走路、弯腰、蹲下、伸手、转身,所有动作由同一模型统一协调。

一个典型的例子:控制 Apptronik Apollo 2 人形机器人执行指令——"把浇水壶放到底层架子的绿色箱子里"。Apollo 2 自主走到桌前,捡起浇水壶,走了几步到架子前,精准放入目标位置。整个过程涉及行走、抓取、定位、放置等多个子任务,过去需要分别编程,现在由模型端到端完成。

一个诚实的注脚:机器人的移动速度仍有提升空间,但这是首次在真实场景中验证全身协调控制的能力闭环。

传统机器人控制

预编程或远程操作,只能执行固定、重复的任务序列,无法适应环境变化。

Gemini Robotics 2

端到端学习,同一模型控制全身,可自主适应不确定环境,任务完成率中到高。

03精细操作:从两指夹爪到五指灵巧手

要在人类环境中真正有用,机器人需要灵巧度。Gemini Robotics 2 支持从简单到复杂的多种末端执行器:

2指平行夹爪
Franka Duo
5指灵巧手
SharpaWave
22自由度
SharpaWave 手
200+示例
适配新形态

SharpaWave 五指手上,模型完成了打结、密封拉链袋等精细动作。在 Franka Duo 双机械臂平台上,使用标准两指夹爪完成了紧密包装等复杂任务。同一模型权重,无需修改即可切换到不同硬件。

注:多手指精细操作(如打结、穿针)的成功率目前仍低于全身控制任务,是持续攻关的方向。精度和速度正在向人类水平逼近。

多手指精细操作仍具挑战——这是当前技术路线最诚实的边界。

04多机器人协作:1+1 > 2

Gemini Robotics 2 首次引入多机器人协作能力。不同类型、不同形态的机器人可以实时通信,分工完成单一机器人无法独立完成的复杂工作流。

例如,一个人形机器人负责搬运重物,另一个协作臂机器人负责精细组装,第三个移动平台负责物料中转——三台机器人在同一任务框架下自主协调,无需人工干预。

这种协作能力的关键在于 Gemini Robotics ER 2 的推理层:它观察环境、拆解任务、分配子任务给不同机器人,并持续跟踪进度。如果某个步骤失败,模型能自主纠错或请求人类介入。

观察环境拆解任务分配子任务执行与跟踪纠错与完成

注:多机器人协作目前适用于结构化场景,复杂动态环境下的实时协调仍在持续迭代中。

05安全:ASIMOV-Agentic 基准与人类接近检测

随着机器人能力增强,安全成为最核心的课题。DeepMind 推出 ASIMOV-Agentic 基准,专门评测机器人智能体在不确定环境中的安全决策能力:

传统安全测试

静态规则检查,无法覆盖动态交互场景,缺乏对不确定性的处理。

ASIMOV-Agentic

评测机器人拒绝不安全工具调用、预测任务可行性、主动请求人类介入的能力。

Gemini Robotics ER 2 在安全约束遵循和人类接近检测基准上,达到所有 DeepMind 机器人模型中最优水平。当检测到人类靠近时,模型能自动触发安全工具调用,使机器人安全停止——这是协作安全标准的关键要求。

注:安全技术报告已同步发布,详细说明了多层级安全框架的设计与验证方法。

06编辑核心判断

Gemini Robotics 2 的真正价值,不在于单项指标的提升,而在于它第一次把"全身控制""精细操作""多机协作""本地运行"这四件事放在同一个智能框架里解决。过去的机器人系统往往只能做好其中一两项。

但也要看到边界:多手指精细操作的成功率仍不理想,移动速度远未达到人类水平。从实验室到家庭和工厂,中间还有很长的工程化距离。

一个诚实的观察:Gemini Robotics 2 证明了"模型架构 + 系统工程"的协同效应正在超越单纯的参数竞赛,但物理世界的通用智能仍需跨越硬件、成本、安全三座大山。

编辑核心判断

机器人领域的竞赛正在从"单任务自动化"转向"通用智能体"——谁先打通执行、推理、协作、安全的全链路,谁就真正掌握了物理世界的入口。

现在就能用

Gemini Robotics ER 2 已上线 Google AI Studio,VLA 和 On-Device 模型面向早期合作伙伴开放。开发者可通过官方渠道申请接入。

ai.google.dev → 申请体验

* 当前为早期合作伙伴阶段,公开使用入口将逐步开放