谷歌发布 Gemini Robotics ER 2:为机器人装上能看视频、能规划任务、能协作的"高级大脑"
7 月 30 日,Google DeepMind 正式推出 Gemini Robotics ER 2,定位为机器人"高级大脑"——它不直接控制电机,而是通过实时视频理解、多步骤任务编排与多机器人协作,让机器人真正"看懂"物理世界并自主决策。该模型现已通过 Gemini API 面向开发者开放。
7 月 30 日,Google DeepMind 正式推出 Gemini Robotics ER 2,定位为机器人"高级大脑"——它不直接控制电机,而是通过实时视频理解、多步骤任务编排与多机器人协作,让机器人真正"看懂"物理世界并自主决策。该模型现已通过 Gemini API 面向开发者开放。
Gemini Robotics ER 2 在三个关键维度上建立了可量化的优势:进度追踪、时刻定位、执行速度。以下数据均来自官方公开评测,可与上一代模型及竞品直接对比。
注:柱形宽度表示相对水平,用于直观对比。时刻查找的 91.3% 准确率搭配 0.96 秒平均绝对距离,竞品模型需更高算力才能接近该精度,而 ER 2 以 4 倍速度实现。
"Gemini Robotics ER 2 在时刻查找任务上,以远低于竞品的计算成本实现了同级精度——这是物理世界机器人真正可用的门槛。"
更重要的是,这些能力建立在连续视频流理解之上,而非静态快照。机器人可以实时"看到"自己的进度:灯泡拧紧了没有?垃圾袋系好了没有?——确认无误后再进入下一步,而不是盲目执行。
"高级大脑"不只是一个概念。以下案例展示了 Gemini Robotics ER 2 在物理世界中如何完成任务编排与自我纠错。
Gemini Robotics ER 2 并非简单的参数升级。它在架构层面引入了三项关键变化:
基于静态图像或短片段进行推理,任务进度依赖外部信号反馈,无法实时自我纠错。多机器人场景需要分别编程,缺乏统一语义层。
基于连续视频流进行实时推理,内建进度分类与时刻查找能力。引入共享语义理解层,支持异构机器人直接协作。集成 Gemini Live API,延迟降低 4 倍。
更核心的变化在于"边思考边执行"的架构设计:ER 2 在推理下一步动作的同时,不中断当前动作的执行。这一"并行思考"能力,是它能在物理世界中流畅运作的关键。
与 ER 1.6 相比,ER 2 在工具编排能力上全面超越——无论底层控制模式是真实 VLA、模拟 VLA 还是人类远程操作,ER 2 的编排准确率均显著领先。
物理世界中的机器人,必须同时满足两件事:完成任务和保证安全。ER 2 在这两个方向上都做了针对性设计。
"Gemini Robotics ER 2 是我们最安全的模型——在 Safety Instruction Following 和 Human Proximity 基准上取得显著领先。"
以上四项能力均通过公开基准测试验证。安全测试采用全新的 VLA 编排安全评估体系,考核模型在物理约束、环境监控、可行性判断与人类澄清四个维度的表现。
一个具体的场景:当人形机器人正在搬运重物,有人突然从侧面走近——ER 2 会立即暂停动作,待人员离开安全区域后再自主恢复,全程无需人工介入。这种"感知-暂停-恢复"的闭环,是物理世界安全部署的基础能力。
Gemini Robotics ER 2 的真正价值,不在于某一个指标的提升,而在于它证明了"机器人高级大脑"可以同时做到三件事:实时视频理解、多步任务编排、异构机器人协作。这比单纯提升某个模型的参数更有意义——因为物理世界的复杂性,从来不是单一模型能解决的。当同一套语义理解系统可以同时指挥轮式机器人、人形机器人和机械臂协同工作时,我们离"机器人真正融入日常生活"才近了一步。
Gemini Robotics ER 2 已通过 Gemini API 和 Google AI Studio 面向开发者开放,企业用户可通过 Gemini Enterprise Agent Platform 申请私有预览。官方提供 Spot demo 及多机器人协作示例代码,可快速上手构建自己的物理 AI 智能体。
ai.google.dev → 开始构建