AI·快讯
🤖 具身推理 · 模型发布

机器人"大脑"看懂视频、实时纠错、多机协作 —— Gemini Robotics ER 2 发布

7 月 30 日,Google DeepMind 正式发布 Gemini Robotics ER 2,一款专为机器人设计的"具身推理"模型。它通过连续视频流理解物理世界、自主规划多步任务,并首次实现跨机型多机器人协作——在时刻查找准确率上达到 91.3%,平均绝对距离仅 0.96 秒,执行速度提升 4 倍

综合公开信息整理 2026-07-30 全文约 4 分钟读完
#Gemini Robotics ER 2 #具身智能 #多机器人协作 #视频理解 #Google DeepMind
🎯 91.3% 时刻查找准确率 · 关键帧定位
0.96s 平均绝对距离 · 毫秒级响应
4× 执行速度提升 · 实时物理世界

⚡ 30 秒速览

  • 核心能力:连续视频流实时追踪任务进度,自主纠错,精确判断"何时完成"并切换下一步。
  • 关键突破:时刻查找准确率 91.3%,平均绝对距离 0.96 秒;进度分类准确率 57.4%,均领先前代及前沿模型。
  • 多机器人协作:首次实现跨机型语义共享——Apptronik Apollo 2 与 Franka F3 Duo 在统一理解下协同完成复杂任务。
  • 安全升级:Human Proximity 基准大幅提升,可自主检测人体靠近并暂停,人离开后恢复工作。
  • 开放使用:即日起通过 Gemini API、Google AI Studio 向开发者开放,代码示例已发布。

01核心能力总览 从"感知"到"执行"的跨越

Gemini Robotics ER 2 被设计为机器人的"高层大脑"——它不直接控制电机,而是负责理解环境、规划任务、调用工具,并将执行交给底层的视觉-语言-动作(VLA)模型。这种分层架构让机器人可以"边思考边行动",无需停顿。

ER 1.6(前代)

静态图像理解为主,单步任务规划,单机器人独立操作,推理与执行串行。

ER 2(新一代)

连续视频流实时理解,多步任务自主编排与纠错,跨机型多机器人协作,推理与执行并行。

ER 2 原生集成 Gemini Live API,通过双向流式端点实现低延迟任务编排——它可以在机器人执行当前动作的同时,"思考"下一步该做什么,消除传统"停-想-动"的割裂感。

连续视频理解 多步任务规划 工具编排 · VLA 实时进度追踪 自主纠错重试 跨机型协作

02关键性能数据 用数字衡量"具身推理"

机器人智能最难的部分不是"看清",而是"判断何时完成"。ER 2 在两项核心任务上取得了显著进展:

📊 进度分类(连续帧 → 5 级进度)

Gemini Robotics ER 257.4% 准确率
57.4
ER 1.6 及前沿模型前代基线

🎯 时刻查找(精确到帧的关键事件定位)

Gemini Robotics ER 291.3% 准确率 / 0.96s 平均绝对距离
91.3
更大规模模型类别更高算力成本

注:进度分类将视频帧划分为 0-20%/20-40%/40-60%/60-80%/80-100% 五个进度区间;时刻查找以"停止倒咖啡"类事件为基准,柱形为相对展示,非零起点。ER 2 在时刻查找上以 4 倍执行速度实现了与更大模型竞争的水平。

一个诚实的注脚:57.4% 的进度分类准确率虽然领先前代和所有竞品,但绝对值仍有提升空间——这反映了"连续进度理解"本身就是一项极其困难的任务,人类标注者之间的一致性也仅在 65% 左右。

03它到底能做什么?三个真实场景

🦾 波士顿动力 Spot · 自然语言取物 端到端编排

  • 用户一句"帮我拿袋爆米花",ER 2 自主拆解任务:导航定位 → 机械臂操控 → 抓取确认 → 返回交付。
  • 全程通过 Spot API 编排导航与机械臂动作,实时视频反馈追踪进度,遇到障碍自动调整路径。
代码已开源,开发者可复现完整流程。

🤝 跨机型协作 · Apptronik Apollo 2 + Franka F3 Duo 首次实现

  • 轮式机器人与双臂协作机器人通过 ER 2 的共享语义理解进行任务交接:Apollo 2 负责运输,Franka F3 Duo 负责精密装配。
  • 双方实时同步进度状态,一方完成自动触发另一方启动,无需人为编程协调逻辑。
多机器人协作是 ER 2 的标志性突破——单一机器人能力再强也有物理边界,语义共享让异构集群成为可能。

🛡️ 安全智能 · 人靠近自动暂停 安全基准领先

  • 人形机器人工作中检测到人员进入安全距离,ER 2 自主暂停所有动作,待人员离开后自动恢复。
  • 在 Safety Instruction Following 和 Human Proximity 两项基准上均显著超越 ER 1.6 及其他前沿模型。
安全不是附加功能,而是物理世界部署的前提条件

04空间智能 + 安全 看得准,更做得稳

ER 2 在三个核心空间智能维度上均达到最高准确率:

96%成功/失败检测
(视频流)
10通用仪表类型
含数字屏/刻度尺
↑32%空间 VQA 提升
多模态理解
↑28%安全指令跟随
Human Proximity

注:成功/失败检测从静态快照升级为原始视频流分析;通用仪表读数覆盖圆形表盘、数字显示屏、线性刻度尺、液体温度计等 10 种类型;安全基准为 ER 2 对比 ER 1.6 的相对提升。

特别值得注意的是成功/失败检测——它不再依赖静态快照,而是通过连续视频流捕捉执行过程中的洒落、滑动、错位等异常,在任务执行中实时纠错,而非事后复盘。

🔓 开放给开发者:Gemini Robotics ER 2 即日起通过 Gemini API、Google AI Studio 及 Gemini Enterprise Agent Platform 提供。开发者可声明低层控制接口(VLA 模型、导航 API 等)作为工具,流式输入多模态视频/音频/文本,构建自己的物理 AI 智能体。
编辑核心判断

机器人 AI 正在经历从"感知"到"执行"的质变。Gemini Robotics ER 2 的价值不在于单个指标的刷新,而在于它证明了视频理解与物理行动可以闭环运行——并且这个闭环对开发者开放了。多机器人协作的语义共享,可能比任何单机性能提升都更具长期意义:物理世界的任务从来不是一台机器能完成的。

现在就上手

Gemini Robotics ER 2 已通过 Gemini API 和 Google AI Studio 向所有开发者开放,配置示例与提示工程指南已同步发布。

Google AI Studio → 开始构建