🤖 具身智能 · 技术突破

Gemini Robotics 2 发布:三模型协同实现全身智能控制,机器人迈入"可适应"新阶段

7 月 30 日,Google DeepMind 发布 Gemini Robotics 2,这是首个实现人形机器人全身智能控制的 VLA 模型系列——从脚到指尖的完整控制,数小时内适配全新机器人本体,并支持多机器人协作

综合公开信息整理 2026-07-30 全文约 3 分钟读完
#Google DeepMind #Gemini Robotics #具身智能 #VLA 模型
3 个模型 VLA 控制 + 具身推理 + 本地端,各司其职
数小时 适配全新机器人本体,少于 200 个示例
最高 92% 多指灵巧操作成功率

⚡ 30 秒速览

  • 赢在哪:Gemini Robotics 2 首次实现人形机器人全身智能控制,从脚到指尖全覆盖,并支持多机器人协作
  • 三模型分工:VLA 模型控制动作 + ER 2 模型作为"大脑"规划决策 + 本地端模型实现快速适配,各司其职
  • 能力数据:全身操控成功率 45.7%–76.3%,多指灵巧操作最高达 92%,数小时(<200 个示例)即可适应新本体。
  • 安全升级:推出 ASIMOV-Agentic 基准,人类接近时自动停止,无人后自主恢复,是迄今最安全的机器人模型。
  • 开放状态:ER 2 已在 Google AI Studio 开放,VLA 与本地端模型对早期合作伙伴开放。

01三模型,各司其职 VLA 控制 + 具身推理 + 本地端

大多数机器人仍是预先编程或远程操控的,只能执行狭窄、重复的任务序列。它们缺乏真正的自主学习和适应能力。Google DeepMind 的解法是:为机器人搭载多个 AI 模型,各司其职

🦾

Gemini Robotics 2

VLA 控制模型

视觉+语言→马达控制,实现从脚到指尖的完整人形机器人控制,大幅提升双手与夹爪的灵巧操作能力。

全身控制 灵巧操作
🧠

Gemini Robotics ER 2

具身推理 VLM

机器人的"大脑 Agent",与人类沟通、理解物理世界,规划数分钟的多步骤任务,支持多机器人团队协作。

任务规划 多机协作

On-Device 2

本地端 VLA

专为设备本地运行设计,无需网络。继承运动迁移技术,数小时(<200 个示例)即可适应全新双臂机器人本体。

离线运行 快速适配

注:三个模型可独立或协同工作。VLA 模型负责"动作执行",ER 2 负责"思考决策",On-Device 2 负责"本地化适配"。实际部署时可根据任务需求组合使用。

02能力实测 三个任务,三种难度

Google DeepMind 公开了多段完全自主的机器人演示视频,并附带了详细的成功率评估数据。以下三个案例覆盖了从全身控制到精细操作的不同维度。

🚶 人形机器人全身控制:从走到放,一气呵成 自主完成

  • 指令:"把浇水壶放到底层架子的绿色箱子里。"——仅此一句,Agent 自主理解。
  • Apollo 2 人形机器人自主走到桌前拿起水壶,再走到架子旁精准放置,全程无远程干预
  • 涉及全身协调:行走、抓取、转向、放置,每一步都需要实时适应环境。
三类全身操控平均成功率:45.7%–76.3%。难度最高的是"行走+抓取+放置"的完整链路,较低分主要来自环境不确定性。

🤏 五指灵巧操作:打结、拧灯泡、封夹链袋 最高 92%

  • 22 自由度五指 SharpaWave 手,执行打结拧灯泡密封夹链袋等极度精细的动作。
  • 这些任务对触觉反馈和实时协调要求极高,过去只有人类或专用机械臂能完成。
  • 与传统两指夹爪不同,五指手需要同时控制 22 个自由度,推理复杂度指数级上升
多指任务成功率:32%–92%。打结类任务接近下限,拧灯泡和密封夹链袋接近上限。灵巧操作仍是具身智能的"硬核"挑战。

📦 标准夹爪操作:紧密包装与精细放置 稳定发挥

  • Franka Duo 平台搭载标准两指平行夹爪,执行紧密包装、物品分类等任务。
  • 相比五指手,两指夹爪的控制更简单,但需要在有限的抓取自由度中完成任务。
  • 模型能自主调整夹爪角度和力度,适应不同形状和材质的物体。
Franka Duo 抓取器成功率:74.2%–89.6%。标准夹爪任务表现稳定,接近实用化水平。

注:所有演示视频均为"完全自主"机器人的实时录像,与业界某些使用远程操作员的演示形成对比。成功率数据来自 Google DeepMind 内部评估报告。

03为何是谷歌做出来了? 软件先行,智能层定义一切

一个关键事实:谷歌做的是软件层,不是机器人本体。Gemini Robotics 2 可以运行在多种机器人硬件上,包括 Apptronik 的 Apollo 2 人形机器人、Franka 的机械臂等。

这与传统机器人公司的路径截然不同。大多数厂商从硬件出发,再为硬件适配软件。谷歌的答案是:先打造通用的机器人智能层,再适配不同硬件

传统机器人路径

预先编程或远程操控,只能执行狭窄、重复的任务序列。技能迁移困难,每个新任务都需要重新编程。

Gemini Robotics 2 路径

AI 模型驱动,自主理解环境并规划动作。技能可跨本体迁移,数小时适应新硬件,支持多机器人协作。

Gemini Robotics 2 的架构继承自 Gemini 1.5 系列,并在运动迁移、多模态理解、安全推理三个方向上做了关键升级。从技术演进看,搜索引擎时期的意图理解能力,被迁移到了物理世界的动作理解中——这是谷歌二十余年 AI 积累的"溢出"效应。

🔍 一个诚实的注脚:这些机器人并非通用型设备,不能胜任各种任务。每个模型都经过专门训练(结合人工远程操作、视频示例和模拟)来执行特定任务。通用性仍是具身智能的终极挑战。

04安全,是机器人走进现实的最后一道门槛

"安全问题更加紧迫,因为你要让它们面对大量不同的场景,会出现很多不确定性。"Google DeepMind 团队负责人 Carolina Parada 表示。Gemini Robotics 2 在安全方面做了三个关键升级。

ASIMOV安全编排基准
Agentic不确定性求解
安全约束遵循率最高
人类接近自主停止+恢复

新推出的 ASIMOV-Agentic 基准,专门衡量具身推理智能体在安全方面的表现:能否拒绝 VLA 发出的不安全工具调用请求?能否在任务不确定时主动请求人工干预?

在安全约束遵循和人类接近度基准上,Gemini Robotics ER 2 是迄今为止最安全的机器人模型。当有人靠近时,它能成功停止人形机器人,并在区域无人后自主恢复工作——这是协作安全标准中的关键要求。

注:安全评估采用"传统物理安全措施 + AI 安全框架"的多层次方法。ASIMOV-Agentic 基准已开源,社区可复现。

编辑核心判断

Gemini Robotics 2 证明:机器人能力的上限,不再由硬件决定,而是由智能软件定义。当"学习"取代"编程",硬件差距可以被软件快速抹平——这是一条正在被跨越的分水岭。

现在就能用

Gemini Robotics ER 2 已在 Google AI Studio 开放,支持开发者直接体验具身推理能力。
VLA 模型与本地端模型面向早期合作伙伴开放,可通过 Gemini Enterprise Agent Platform 申请。

Google AI Studio → 体验 ER 2