🔬 具身智能 · 开源系统

不要标注、不用训练:首个开放词汇 3D 占据地图系统 FreeOcc 开源,零样本跨场景性能超两倍

香港科技大学(广州)陈昶昊团队联合 MBZUAI 研究者提出 FreeOcc——首个无需训练(training-free)的开放词汇三维占据预测系统,论文已被 RSS 2026 接收,代码与数据集全量公开。单目输入即达 31.29 IoU / 13.86 mIoU,RGB-D 达 34.40 IoU / 15.84 mIoU,几何与语义精度均超现有自监督方法两倍以上。

来源:综合公开信息整理 RSS 2026 论文接收 全文约 4 分钟读完
#FreeOcc #三维占据预测 #开放词汇 #RSS 2026 #具身智能
🥇 首个 training-free 开放词汇占据预测系统
2×+ IoU / mIoU 双超自监督基线
55.65IoU ReplicaOcc 零样本跨场景 · RGB-D

TLDR 30 秒速览

  • 是什么:首个无需训练的开放词汇 3D 占据预测系统,仅用单目或 RGB-D 图像序列,在线构建全局一致的开放词汇占据地图,支持任意文本查询
  • 硬指标:EmbodiedOcc-ScanNet 上 IoU / mIoU 双超现有自监督方法 2 倍以上;跨数据集迁移到 ReplicaOcc,学习式方法几乎失效,FreeOcc 仍稳定输出。
  • 方法论:SLAM 建几何锚 → 3DGS 稠密表达 → 预训练 VLM 开放语义 → 概率投影转体素占据。不训练任何面向数据集的网络权重。
  • 工程含金量:几何锚定更新让建图 FPS 从 8.8 → 25.0,占据 IoU 从 27.98 → 45.03
  • 全量开源:论文、代码、ReplicaOcc 数据集、项目主页均已公开,可直接复现与二次开发。

01一组数字:几何与语义的双倍超越 EmbodiedOcc-ScanNet

🥇 FreeOcc · RGB-D港科大(广州)× MBZUAI · mIoU 15.84
34.4
FreeOcc · 单目同团队 · mIoU 13.86
31.3
GaussTR自监督基线 · mIoU 4.95
15.6
GaussianOcc自监督基线 · mIoU 4.34
10.2

注:柱形自 8 分起缩放,非零起点;右侧为几何 IoU,语义 mIoU 见名称下方小字。自监督基线仍需要真实相机位姿作为输入,而 FreeOcc 完全不使用占据真值、语义标注与真实位姿。在团队构建的跨数据集基准 ReplicaOcc 上,FreeOcc RGB-D 版本达 55.65 IoU / 20.90 mIoU,监督与自监督方法几乎无法完成零样本迁移。

02在这之前,占据预测有个默认前提:你得先有标注

高质量三维占据真值,要经过三维重建、体素化、逐体素语义标注三道工序,成本远高于二维图像标注。而室内具身场景中拿得出手的数据集,翻来覆去只有两个。

标注稀缺只是表面问题。

更深的问题在范式里:监督方法学到的更像一套“数据集记忆”——相机内参、尺度分布、外观风格、标签体系被一起打包进权重,换一个场景就集体失效。这正是学习式端到端方法的根本矛盾。

学习式端到端

依赖高质量三维真值标注;一旦进入未见过的场景,几何与语义预测迅速退化,重新采集数据再训练几乎不可行。

FreeOcc 无需训练

不训练任何面向数据集的网络权重,在线组合 SLAM + 3DGS + 预训练 VLM,进入新环境即插即用、直接推断。

于是真正的工程难点浮出水面,一共三座:

  • 3DGS 的目标是渲染正确,不是几何精确。现有 3DGS-SLAM 更关注多视角渲染质量,直接转为体素占据会出现边界漂移、薄结构错位、全局拓扑不规整。
  • 缺乏适用于占据式 SLAM 的评估机制。优化器不断重塑高斯场,使其变成自由场;仅靠 Sim(3)/SE(3) 群变换对齐,无法吸收累积的局部补偿误差。
  • 现有基准根本测不出开放词汇能力。OccScanNet 把大量类别合并为 “furniture” 和 “objects”,开放类别下的语义理解无法被量化。

03答案:不训练模型,组装系统 四层模块化地图

点云地图3DGS 地图语义地图占据地图

四层表示在机器人观测过程中持续联合更新,每一层解决一个具体问题:

01
点云地图 · SLAM 几何锚

基于 DROID-SLAM 估计相机位姿、重建半稠密点云,为全局一致性提供统一坐标系。补充实验还验证了 MASt3R-SLAM 与 VGGT-SLAM 作为骨干的可替换性。

02
3DGS 地图 · 几何一致的高斯

提出几何感知初始化(G-ini)与几何锚定高斯更新(GAGU),让高斯的几何中心始终锚定在 SLAM 三维点上,不再沿渲染误差方向自由漂移。

03
语义地图 · 开放词汇关联

预训练视觉语言模型提取语言对齐特征,基于几何对应关系将二维像素语义嵌入提升到三维高斯基元,每个高斯都携带开放词汇语义特征

04
占据地图 · 概率投影

通过概率式高斯到占据投影,输出体素占据概率与开放词汇语义分数。查询时文本编码器生成 query embedding,在三维空间中做相似度匹配。

查询方式也因此足够直觉:输入“台灯在哪里”“红色椅子在哪里”,系统直接在三维占据地图中定位目标区域,结果可用于导航、避障与抓取。

04组件装完,效果如何? 消融与扩展性

配置(RGB-D)IoUmIoU帧率
无 GAGU · 无 G-ini27.9811.208.8 FPS
+ 几何锚定更新 GAGU40.1816.0325.0 FPS
完整 FreeOcc45.0318.3724.6 FPS

注:RGB-D 设置下的组件消融。GAGU 同时带来几何一致性与建图效率收益;G-ini 在不牺牲帧率的前提下进一步改善高斯初始化质量。

再看开放词汇的扩展能力——类别从 10 个扩到 40 个,mIoU 依然保持可用水平:

31.06top-10 mIoU
23.02top-20 mIoU
16.57top-30 mIoU
12.01top-40 mIoU

注:ReplicaOcc 上的开放词汇定量评估。对比之下,学习式方法在该数据集上几乎无法生成有效的零样本语义占据结果。

这不是一个“记性好”的模型,而是一个“看得懂”的系统。

05实验室里再好看,不如真机走一遭

🏭 真实传感器:从数据流到占据地图,全程在线 已部署

  • 部署平台:Intel RealSense D435i 深度相机 + i9-14900KF + RTX 5090。
  • 直接接收实时 RGB-D 数据流,不依赖预录轨迹、真实相机位姿或离线优化
  • 室内外场景持续构建三维高斯地图,并将开放词汇语义稳定投影到占据地图中。
运行观察:几何与语义占据图随观测增量生长,全局一致性保持稳定

☕ 语义定位:三只杯子,三种颜色,一次说清 细粒度查询

  • 桌面上多个外观相似但颜色不同的杯子,FreeOcc 按 “红色杯子”“黄色杯子”“蓝色杯子” 文本查询准确区分并定位。
  • 场景级开放词汇标签由 Qwen3-VL 自动生成并接入系统,FreeOcc 负责几何与语义的在线融合。
  • 这类细粒度、类别开放的小目标,正是封闭类别占据预测方法覆盖不到的盲区。
一个分水岭正在出现:机器人的空间感知,从“看到”走向“听懂”
编辑核心判断

“无需训练”的含金量,不在省算力,而在换范式——它把占据预测从“数据集专用模型”推向“环境自适应系统”。

一个诚实的注脚:当前 IoU 绝对值并不算高,系统上限被 SLAM 几何质量与预训练 VLM 语义质量双重锁死。但竞争维度已经改变:占据预测的下一场较量,不再是“谁的标注多”,而是“谁的系统更通用”。

开源即用,欢迎复现

论文、代码、数据集与可视化已全部公开,可作为机器人占据感知研究的基座。