👁️ 视觉感知 · 突破性技术
AI 视觉主动感知技术登顶 EmbodiedVisionBench,3D 物体识别准确率打破纪录
一项基于 Transformer 架构的主动感知技术,在具身智能标准评测集 EmbodiedVisionBench v3 上以94.3% 的 3D 物体识别准确率登顶,超越此前所有视觉语言模型与经典感知流水线,成为首个在「主动视角选择 + 识别」联合任务上达到人类专家级水平的 AI 系统。
综合公开信息整理•
2026-07-24•
全文约 3 分钟读完
#主动感知
#具身智能
#3D 物体识别
#Transformer
🥇 第 1 名
EmbodiedVisionBench v3 · 12 个参评系统
94.3%
3D 物体识别准确率
92.7%
主动视角选择准确率
⚡ 30 秒速览
- 赢了谁:超越 GPT-5.6-vision(91.2%)、Claude Opus 4.8-vision(90.5%)、Qwen3.7-vl(89.8%)以及传统 SOTA 感知流水线(88.1%)。
- 评测硬在哪:200 个真实物理场景、600 个物体实例,考「智能体主动选择下一个最佳视角 + 识别物体」——不是被动看图,而是主动探索。
- 技术核心:基于 Transformer 的「视角规划器」+「识别解码器」联合训练,模型自主决定下一步看哪里,再基于多视角信息做识别决策。
- 数据集:在 HM3D、Gibson、Replica 三大室内场景数据集上联合训练,覆盖 3000+ 场景。
- 真正意义:机器人无需预先扫全场景,边看边识别,效率提升 3 倍以上。
01EmbodiedVisionBench v3 总榜 主动感知技术登顶
🥇 主动感知 Transformer视觉感知模型
94.3
GPT-5.6-visionOpenAI
91.2
Claude Opus 4.8-visionAnthropic
90.5
注:为便于直观对比,柱形自 85 分起缩放,非零起点;分差以标注分数为准。榜首与第二名分差 3.1 个百分点,与第五名分差 6.2 个百分点。
02EmbodiedVisionBench:测的是真正的「主动能力」
传统的物体识别评测是「看图答题」——给定一张图,问模型这是什么。现实世界的机器人不会被推到一张完美的图片前。
它得自己决定:往左转还是往右转?凑近看还是退远看?
传统评测(ImageNet / COCO)
考「识别一张给定图片」——静态、被动、与物理世界脱节。
EmbodiedVisionBench v3
考「主动探索并识别」——模型控制虚拟相机,自主选择下一个视角,最后基于多帧信息做出识别判断。
200真实物理场景
600物体实例
3室内数据集
12参评系统
三大数据集:HM3D、Gibson、Replica,覆盖住宅、办公室、公共场所等场景。评分采用「物体识别准确率 + 视角选择效率」双指标加权。
一个诚实的注脚:识别准确率是联合指标,包含「选对视角」和「识别对物体」两层。选错视角但认出物体,得分会打折。模型在视角选择任务上取得了92.7% 的单独准确率,意味着它真的知道去哪里看。
03它到底会做什么?三个满分场景
🔍 厨房场景:区分「马克杯」与「调料罐」双满分 1.0
- 初始视角只能看到两个物体边缘,颜色相似,传统模型误判率高达 40%。
- 模型自主选择侧上方 45° 视角,观察到杯柄结构,确认是马克杯;第二个视角选择俯视,确认内部深度,排除调料罐。
- 全程仅需 3 个视角,人类专家平均需要 4 个。
评分维度:识别准确率 / 视角效率 / 视角有效度 —— 全部满分。
🛋️ 客厅场景:识别「沙发上的抱枕」满分 1.0
- 抱枕被沙发扶手遮挡,初始视角仅可见 20% 面积。
- 模型预测遮挡区域可能有物体,主动选择靠近沙发扶手的前方视角,确认抱枕存在及形状。
- 并在第三个视角中辨认出抱枕花纹,结合纹理特征完成识别。
LLM 评审结论:「视角选择策略接近人类直觉」。
📦 办公室场景:低光环境下的「白色键盘」满分 1.0
- 桌面有 5 个物体,白色键盘与白色桌面融为一体,RGB 信息高度相似。
- 模型选择俯视 + 侧光方向视角,利用阴影和键盘按键的凹凸纹理完成识别。
- 对比测试中,所有基线模型至少需要 6 个视角才能识别,该模型仅用 4 个。
04技术拆解:把「看什么」和「看到什么」放到一起学
这项技术的核心突破在于联合训练——过去,视角选择(运动规划)和物体识别(感知)是两套独立系统,各自训练再拼装。误差会累积,效率会打折。
而现在,一个 Transformer 架构同时优化两个目标:
当前视角图像→视角规划器→下一个最佳视角→新视角图像→识别解码器→物体类别
视角规划器预测「看了这个新视角,我能获得多少信息增益」,识别解码器则利用多视角信息做鲁棒推理。两套模块共享同一个底层视觉编码器,梯度反向传播同步更新。
这种做法让模型在训练中自然学会「信息驱动」的探索策略——它不会去看已经清楚的地方,而是主动寻找未知区域。
这并非偶然。
从技术谱系看,这项工作是「具身智能」领域的一个关键拼图:机器人不再只是被动感知,而是主动探索。这正是通向通用移动操作机器人的必经之路。
编辑核心判断
主动感知的突破,意味着具身智能从「能看见」进化到「会去看」。下一个分水岭,将是「看了之后主动操作」。
▶论文与代码已开源
技术细节已在 arXiv 公开,评测框架与预训练模型权重均已开源,可在 GitHub 上复现全部结果。
arXiv → 搜索论文标题