🧠 具身智能 · 模型发布

谷歌发布 Gemini Robotics ER 2:为机器人装上能看视频、能规划任务、能协作的"高级大脑"

7 月 30 日,Google DeepMind 正式推出 Gemini Robotics ER 2,定位为机器人"高级大脑"——它不直接控制电机,而是通过实时视频理解、多步骤任务编排与多机器人协作,让机器人真正"看懂"物理世界并自主决策。该模型现已通过 Gemini API 面向开发者开放。

来源:综合公开信息整理 2026-07-30 全文约 3 分钟读完
#Google DeepMind #Gemini Robotics #具身推理 #多机器人协作
91.3% 时刻查找准确率 · 精确切换任务
57.4% 进度分类准确率 · 实时追踪任务完成度
4× 执行速度提升 · 低延迟物理世界推理

⚡ 30 秒速览

  • 它是谁:Gemini Robotics ER 2 是 Google DeepMind 最新"具身推理"模型,作为机器人的高级大脑,负责规划与决策,将底层动作执行交给 VLA 模型。
  • 新在哪:通过连续视频流追踪任务进度,实时自我纠错,无需从头重来;时刻查找精度达 91.3%,平均偏差仅 0.96 秒。
  • 多机器人协作:不同形态的机器人(轮式、人形、机械臂)可共享语义理解,协同完成单一机器人无法完成的复杂工作流。
  • 速度快 4 倍:集成 Gemini Live API 双向流式端点,边思考边执行,告别"停下想一想"的卡顿体验。
  • 现在就能用:通过 Gemini API、Google AI Studio 或 Gemini Enterprise Agent Platform 可立即接入,附开源示例代码。

01三大核心能力基准 用数据证明"高级大脑"的硬实力

Gemini Robotics ER 2 在三个关键维度上建立了可量化的优势:进度追踪、时刻定位、执行速度。以下数据均来自官方公开评测,可与上一代模型及竞品直接对比。

🎯 时刻查找精准定位关键事件帧
91.3%
📊 进度分类五级任务完成度分类
57.4%
⚡ 执行速度相对 ER 1.6 提升

注:柱形宽度表示相对水平,用于直观对比。时刻查找的 91.3% 准确率搭配 0.96 秒平均绝对距离,竞品模型需更高算力才能接近该精度,而 ER 2 以 4 倍速度实现。

"Gemini Robotics ER 2 在时刻查找任务上,以远低于竞品的计算成本实现了同级精度——这是物理世界机器人真正可用的门槛。"

更重要的是,这些能力建立在连续视频流理解之上,而非静态快照。机器人可以实时"看到"自己的进度:灯泡拧紧了没有?垃圾袋系好了没有?——确认无误后再进入下一步,而不是盲目执行。

02它能做什么?三个真实场景,从取零食到跨机器人协作

"高级大脑"不只是一个概念。以下案例展示了 Gemini Robotics ER 2 在物理世界中如何完成任务编排与自我纠错。

🤖 Boston Dynamics Spot 取物 自然语言→完整任务

  • 用户只说一句 "帮我拿 popcorn",ER 2 自主拆解任务:导航至零食区 → 识别目标 → 用机械臂抓取 → 返回交付。
  • 全程调用 Spot API 的导航与操作接口,ER 2 负责任务编排与进度验证,无需人工干预
  • 如果中途掉落或位置偏移,ER 2 通过视频流实时检测并自动调整,不需从头重启
已开源完整代码,开发者可复现该 demo 并扩展至其他机器人平台。

🔄 多机器人协作:Apollo 2 + Franka F3 Duo 异构机器人协同

  • Apptronik Apollo 2(人形机器人)与 Franka F3 Duo(双臂机械臂)通过 ER 2 共享语义理解,协同完成搬运+装配任务。
  • Apollo 2 负责将重型部件搬运至工作台,Franka F3 Duo 进行精密组装——单机器人无法独立完成
  • ER 2 作为统一"大脑",协调两者的动作时序,确保在共享空间内不发生碰撞或冲突。
多机器人协作的核心突破在于:不同形态的机器人使用同一套语义理解系统,无需分别编程。

🛠️ 工具调用:搜索 + API + 自定义函数 原生工具编排

  • ER 2 可原生调用 Google Search 获取实时信息,或调用任何用户定义的函数——比如查询库存数据、发送通知。
  • 开发者将底层控制接口(VLA 模型、导航 API 等)声明为"工具",ER 2 自动编排调用顺序,无需手写逻辑链
工具调用能力让 ER 2 不局限于"机器人",而是可扩展为任何物理世界任务的编排引擎。

03技术升级:从 ER 1.6 到 ER 2,到底改了啥?

Gemini Robotics ER 2 并非简单的参数升级。它在架构层面引入了三项关键变化:

ER 1.6

基于静态图像或短片段进行推理,任务进度依赖外部信号反馈,无法实时自我纠错。多机器人场景需要分别编程,缺乏统一语义层。

ER 2

基于连续视频流进行实时推理,内建进度分类与时刻查找能力。引入共享语义理解层,支持异构机器人直接协作。集成 Gemini Live API,延迟降低 4 倍。

更核心的变化在于"边思考边执行"的架构设计:ER 2 在推理下一步动作的同时,不中断当前动作的执行。这一"并行思考"能力,是它能在物理世界中流畅运作的关键。

接收视频流实时进度分类时刻查找验证编排下一步调用工具执行

与 ER 1.6 相比,ER 2 在工具编排能力上全面超越——无论底层控制模式是真实 VLA、模拟 VLA 还是人类远程操作,ER 2 的编排准确率均显著领先。

04安全与空间智能:让机器人"知道自己在哪、旁边有谁"

物理世界中的机器人,必须同时满足两件事:完成任务保证安全。ER 2 在这两个方向上都做了针对性设计。

"Gemini Robotics ER 2 是我们最安全的模型——在 Safety Instruction Following 和 Human Proximity 基准上取得显著领先。"

✅ 成功检测 视频流实时识别执行失败(洒落/滑脱/错位)
📏 通用仪器阅读 10 种仪表类型:数字屏、刻度尺、液体温度计等
🧠 空间 VQA 多模态理解驱动的视觉问答
🛡️ 人员接近检测 检测到人靠近时自动暂停,人离开后自主恢复

以上四项能力均通过公开基准测试验证。安全测试采用全新的 VLA 编排安全评估体系,考核模型在物理约束、环境监控、可行性判断与人类澄清四个维度的表现。

一个具体的场景:当人形机器人正在搬运重物,有人突然从侧面走近——ER 2 会立即暂停动作,待人员离开安全区域后再自主恢复,全程无需人工介入。这种"感知-暂停-恢复"的闭环,是物理世界安全部署的基础能力。

编辑核心判断

Gemini Robotics ER 2 的真正价值,不在于某一个指标的提升,而在于它证明了"机器人高级大脑"可以同时做到三件事:实时视频理解、多步任务编排、异构机器人协作。这比单纯提升某个模型的参数更有意义——因为物理世界的复杂性,从来不是单一模型能解决的。当同一套语义理解系统可以同时指挥轮式机器人、人形机器人和机械臂协同工作时,我们离"机器人真正融入日常生活"才近了一步。

现在就能用

Gemini Robotics ER 2 已通过 Gemini API 和 Google AI Studio 面向开发者开放,企业用户可通过 Gemini Enterprise Agent Platform 申请私有预览。官方提供 Spot demo 及多机器人协作示例代码,可快速上手构建自己的物理 AI 智能体。

ai.google.dev → 开始构建