不要标注、不用训练:首个开放词汇 3D 占据地图系统 FreeOcc 开源,零样本跨场景性能超两倍
香港科技大学(广州)陈昶昊团队联合 MBZUAI 研究者提出 FreeOcc——首个无需训练(training-free)的开放词汇三维占据预测系统,论文已被 RSS 2026 接收,代码与数据集全量公开。单目输入即达 31.29 IoU / 13.86 mIoU,RGB-D 达 34.40 IoU / 15.84 mIoU,几何与语义精度均超现有自监督方法两倍以上。
香港科技大学(广州)陈昶昊团队联合 MBZUAI 研究者提出 FreeOcc——首个无需训练(training-free)的开放词汇三维占据预测系统,论文已被 RSS 2026 接收,代码与数据集全量公开。单目输入即达 31.29 IoU / 13.86 mIoU,RGB-D 达 34.40 IoU / 15.84 mIoU,几何与语义精度均超现有自监督方法两倍以上。
注:柱形自 8 分起缩放,非零起点;右侧为几何 IoU,语义 mIoU 见名称下方小字。自监督基线仍需要真实相机位姿作为输入,而 FreeOcc 完全不使用占据真值、语义标注与真实位姿。在团队构建的跨数据集基准 ReplicaOcc 上,FreeOcc RGB-D 版本达 55.65 IoU / 20.90 mIoU,监督与自监督方法几乎无法完成零样本迁移。
高质量三维占据真值,要经过三维重建、体素化、逐体素语义标注三道工序,成本远高于二维图像标注。而室内具身场景中拿得出手的数据集,翻来覆去只有两个。
标注稀缺只是表面问题。
更深的问题在范式里:监督方法学到的更像一套“数据集记忆”——相机内参、尺度分布、外观风格、标签体系被一起打包进权重,换一个场景就集体失效。这正是学习式端到端方法的根本矛盾。
依赖高质量三维真值标注;一旦进入未见过的场景,几何与语义预测迅速退化,重新采集数据再训练几乎不可行。
不训练任何面向数据集的网络权重,在线组合 SLAM + 3DGS + 预训练 VLM,进入新环境即插即用、直接推断。
于是真正的工程难点浮出水面,一共三座:
四层表示在机器人观测过程中持续联合更新,每一层解决一个具体问题:
基于 DROID-SLAM 估计相机位姿、重建半稠密点云,为全局一致性提供统一坐标系。补充实验还验证了 MASt3R-SLAM 与 VGGT-SLAM 作为骨干的可替换性。
提出几何感知初始化(G-ini)与几何锚定高斯更新(GAGU),让高斯的几何中心始终锚定在 SLAM 三维点上,不再沿渲染误差方向自由漂移。
预训练视觉语言模型提取语言对齐特征,基于几何对应关系将二维像素语义嵌入提升到三维高斯基元,每个高斯都携带开放词汇语义特征。
通过概率式高斯到占据投影,输出体素占据概率与开放词汇语义分数。查询时文本编码器生成 query embedding,在三维空间中做相似度匹配。
查询方式也因此足够直觉:输入“台灯在哪里”、“红色椅子在哪里”,系统直接在三维占据地图中定位目标区域,结果可用于导航、避障与抓取。
| 配置(RGB-D) | IoU | mIoU | 帧率 |
|---|---|---|---|
| 无 GAGU · 无 G-ini | 27.98 | 11.20 | 8.8 FPS |
| + 几何锚定更新 GAGU | 40.18 | 16.03 | 25.0 FPS |
| 完整 FreeOcc | 45.03 | 18.37 | 24.6 FPS |
注:RGB-D 设置下的组件消融。GAGU 同时带来几何一致性与建图效率收益;G-ini 在不牺牲帧率的前提下进一步改善高斯初始化质量。
再看开放词汇的扩展能力——类别从 10 个扩到 40 个,mIoU 依然保持可用水平:
注:ReplicaOcc 上的开放词汇定量评估。对比之下,学习式方法在该数据集上几乎无法生成有效的零样本语义占据结果。
这不是一个“记性好”的模型,而是一个“看得懂”的系统。
“无需训练”的含金量,不在省算力,而在换范式——它把占据预测从“数据集专用模型”推向“环境自适应系统”。
一个诚实的注脚:当前 IoU 绝对值并不算高,系统上限被 SLAM 几何质量与预训练 VLM 语义质量双重锁死。但竞争维度已经改变:占据预测的下一场较量,不再是“谁的标注多”,而是“谁的系统更通用”。
论文、代码、数据集与可视化已全部公开,可作为机器人占据感知研究的基座。