机器人"大脑"看懂视频、实时纠错、多机协作 —— Gemini Robotics ER 2 发布
7 月 30 日,Google DeepMind 正式发布 Gemini Robotics ER 2,一款专为机器人设计的"具身推理"模型。它通过连续视频流理解物理世界、自主规划多步任务,并首次实现跨机型多机器人协作——在时刻查找准确率上达到 91.3%,平均绝对距离仅 0.96 秒,执行速度提升 4 倍。
7 月 30 日,Google DeepMind 正式发布 Gemini Robotics ER 2,一款专为机器人设计的"具身推理"模型。它通过连续视频流理解物理世界、自主规划多步任务,并首次实现跨机型多机器人协作——在时刻查找准确率上达到 91.3%,平均绝对距离仅 0.96 秒,执行速度提升 4 倍。
Gemini Robotics ER 2 被设计为机器人的"高层大脑"——它不直接控制电机,而是负责理解环境、规划任务、调用工具,并将执行交给底层的视觉-语言-动作(VLA)模型。这种分层架构让机器人可以"边思考边行动",无需停顿。
静态图像理解为主,单步任务规划,单机器人独立操作,推理与执行串行。
连续视频流实时理解,多步任务自主编排与纠错,跨机型多机器人协作,推理与执行并行。
ER 2 原生集成 Gemini Live API,通过双向流式端点实现低延迟任务编排——它可以在机器人执行当前动作的同时,"思考"下一步该做什么,消除传统"停-想-动"的割裂感。
机器人智能最难的部分不是"看清",而是"判断何时完成"。ER 2 在两项核心任务上取得了显著进展:
📊 进度分类(连续帧 → 5 级进度)
🎯 时刻查找(精确到帧的关键事件定位)
注:进度分类将视频帧划分为 0-20%/20-40%/40-60%/60-80%/80-100% 五个进度区间;时刻查找以"停止倒咖啡"类事件为基准,柱形为相对展示,非零起点。ER 2 在时刻查找上以 4 倍执行速度实现了与更大模型竞争的水平。
一个诚实的注脚:57.4% 的进度分类准确率虽然领先前代和所有竞品,但绝对值仍有提升空间——这反映了"连续进度理解"本身就是一项极其困难的任务,人类标注者之间的一致性也仅在 65% 左右。
ER 2 在三个核心空间智能维度上均达到最高准确率:
注:成功/失败检测从静态快照升级为原始视频流分析;通用仪表读数覆盖圆形表盘、数字显示屏、线性刻度尺、液体温度计等 10 种类型;安全基准为 ER 2 对比 ER 1.6 的相对提升。
特别值得注意的是成功/失败检测——它不再依赖静态快照,而是通过连续视频流捕捉执行过程中的洒落、滑动、错位等异常,在任务执行中实时纠错,而非事后复盘。
机器人 AI 正在经历从"感知"到"执行"的质变。Gemini Robotics ER 2 的价值不在于单个指标的刷新,而在于它证明了视频理解与物理行动可以闭环运行——并且这个闭环对开发者开放了。多机器人协作的语义共享,可能比任何单机性能提升都更具长期意义:物理世界的任务从来不是一台机器能完成的。
Gemini Robotics ER 2 已通过 Gemini API 和 Google AI Studio 向所有开发者开放,配置示例与提示工程指南已同步发布。
Google AI Studio → 开始构建