AI·快讯
🤖 机器人 · 能力突破

Google DeepMind 发布 Gemini Robotics 2,机器人全身智能控制新突破

从指尖到脚尖,机器人第一次学会了全身协调。Google DeepMind 今日推出 Gemini Robotics 2,这是一套为机器人打造的智能层,让机器人能够行走、蹲下、伸展、精细操作,甚至与其他机器人协作完成复杂任务。这是继 Gemini Robotics 之后,机器人智能从"上半身"走向"全身"的关键一步。

综合公开信息整理 2026年 全文约4分钟读完
#GeminiRobotics2 #GoogleDeepMind #机器人 #全身控制 #AI Agent
22 自由度 · 五手指精细操作
200 样本 · 快速适应新机器人
3 模型 · 云端到本地全覆盖

⚡ 30秒速览

  • 核心突破:Gemini Robotics 2 实现了从仅上半身控制到全身协调的跨越,机器人可行走、蹲下、伸展、取物、放置,全流程自主完成。
  • 三种模型协同:VLA 模型(GR2)负责行动控制,推理模型(GR ER 2)负责任务规划与自我纠错,本地设备模型(GR On-Device 2)可离线运行,200 个样本即可适应新机器人
  • 精细操作升级:在 Apptronik Apollo 2 上控制 22 自由度五手指 SharpaWave 手,完成打结、密封袋等精细任务;也可操作标准二指夹爪。
  • 多机器人协作:不同类型机器人可通信协作,完成单机器人无法独立完成的复杂工作流,如协同整理房间。
  • 安全体系增强:ASIMOV-Agentic 基准测试,可检测人类接近并自动安全停止,拒绝不安全工具调用,是迄今最安全的机器人模型。

01从"上半身"到"全身" 机器人的第一次

此前,机器人智能体大多只能控制上半身完成桌面任务。而现实世界是为人类动作设计的——需要弯腰、够取、在拥挤空间里保持平衡。Gemini Robotics 2 第一次将物理 AI 扩展到了全身运动。

传统机器人控制

仅上半身操作,限于桌面任务,无法移动或适应复杂空间。

Gemini Robotics 2

全身协调控制,行走、蹲下、伸展、操作,从脚到手的完整动作链。

一个具体的例子:当控制 Apptronik 的 Apollo 2 人形机器人时,只需下达"把喷壶放进底层架的绿色箱子里"。Apollo 2 自主走到桌前、拿起喷壶、走到架子前、精准放置——全程无需人工干预。

这不是简单的"走"+"拿"+"放"的拼接,而是模型在每一个时刻对全身关节的协调控制。运动速度还有提升空间,但这是第一次让机器人真正以"完整身体"去完成真实世界任务。

注:全身控制指机器人从脚底到指尖的完整运动链参与任务执行,区别于仅使用机械臂或上半身的传统方案。

02三个模型,各司其职 从云端到本地的智能层

Gemini Robotics 2 不是一个单一模型,而是一套"智能层"——三个模型分工协作,覆盖从任务规划到物理执行再到离线部署的全链路。

🧠 行动控制

Gemini Robotics 2 (VLA)

视觉-语言-行动模型,直接控制多种机器人形态,一个模型参数支持多款机器人,包括 Apptronik Apollo 2、Franka Duo 等。

🧩 任务规划

Gemini Robotics ER 2

推理模型,作为机器人的"高级大脑",理解任务开始与结束,数百步决策链路中自我纠错,可追踪进度并概括关键事件。

📡 本地运行

Gemini Robotics On-Device 2

最高效的 VLA 模型,离线运行、无网络延迟,继承"运动迁移"技术,<200 样本数小时即可适配全新机器人形态。

三个模型可以独立使用,也可以串联部署:ER 2 接收指令→规划任务→协调 VLA 执行→On-Device 保障本地实时响应。这种架构让机器人既能"思考"又能"行动",且不受网络限制。

注:VLA = Vision-Language-Action 模型,指同时处理视觉、语言和物理动作的端到端模型。

03它到底能做什么?三个典型任务

🧵 精细操作:打结与密封袋 22自由度全手控制

  • 在 Apollo 2 上控制五手指 SharpaWave 手,完成打结、密封拉链袋等需要精细力控的动作。
  • 在 Franka Duo 平台上操作标准二指夹爪,完成紧包装等复杂操作。
  • 多手指精细操作仍是当前技术难点,但 gripper 类任务已实现中高成功率。
评分:全身控制与夹爪操作达中高成功率,多手指灵巧操作仍在持续攻关。

🧹 多步骤任务:整理房间与协作 数百步决策

  • 机器人可自主完成"整理杂乱房间"的完整任务链:行走→识别物品→捡拾→分类放置。
  • 多机器人协作场景:不同类型机器人通信协同,完成单机器人无法独立完成的工作流,如搬运大件物品。
  • ER 2 模型在任务过程中可自我纠错,若某一步失败,自动调整策略继续执行。
任务序列持续数分钟,涉及数百次决策,模型能准确定位任务开始与结束的关键时刻。

🛡️ 安全交互:人类接近自动停止 ASIMOV-Agentic

  • 引入 ASIMOV-Agentic 基准测试,衡量机器人对不安全工具调用的拒绝能力。
  • 模型可预测任务是否可能完成,在不确定时主动请求人类干预。
  • 检测到人类接近时,自动触发安全工具调用,将机器人带至安全停止状态——符合协作安全标准。
Gemini Robotics ER 2 在安全约束遵循和人类接近检测上,是迄今得分最高的机器人模型。

04安全与适应 落地的两个前提

机器人进入真实世界,需要解决两个根本问题:安全可靠快速适配。Gemini Robotics 2 在这两方面都做了针对性设计。

安全体系:多层防护

ASIMOV-Agentic 基准不安全工具调用拒绝人类接近检测自动安全停止

这不仅是理论框架——ER 2 模型在安全测试中的表现是"迄今最好的",能够区分安全与不安全操作,并在物理层面做出响应。

快速适应:200 样本就够了

On-Device 2 模型继承了"运动迁移"技术,仅需不到 200 个示例、数小时适配时间,即可适应全新的双臂机器人形态——即使传感器的形状、自由度和类型完全不同。这意味着一个模型可以快速部署到多种机器人硬件上,大幅降低了落地门槛。

Apptronik Apollo 2 SharpaWave 五手指手 Inspire Franka Duo 二指夹爪 Dexmate 平台 SO101 平台 Trossen 平台

注:以上机器人平台均在 Gemini Robotics 2 的测试中完成了跨形态适配,一套模型参数覆盖多种硬件。

编辑核心判断

Gemini Robotics 2 最本质的进步,是证明了"语言理解+物理控制"的路径可以泛化到全身协调和多机器人协作场景。但一个诚实的注脚:精细操作的成功率与人类水平仍有显著差距,运动速度也远未达到实用标准。机器人智能的下一场战役,将从"能做什么"转向"能做多好"——工程精度,才是真正的护城河。

现在就能用

Gemini Robotics ER 2 已在 Google AI Studio 开放体验,并可通过 Gemini Enterprise Agent Platform 获取私有预览。VLA 和 On-Device 模型面向早期合作伙伴开放。

Google AI Studio → 体验 Gemini Robotics ER 2