🌍 空间智能 · 技术路线

把互联网视频变成空间智能的「太阳能」:单目视频转 360° 动态 3D,数据成本直降两个数量级

当世界模型成为共识,3D 数据却卡在「采不出来」的瓶颈里。影溯科技创始人章国锋的判断是:互联网上海量视频就是最充沛的「阳光」,把 2D 视频高效升维成 3D/4D 训练数据,是空间智能真正 Scale 的唯一路径——这家成立一年的公司,已把单目视频转 360° 动态场景做到技术可行,整体成本比实采方式至少下降一至两个数量级

来源:公开报道 2026-07-22 全文约 4 分钟读完
#空间智能 #世界模型 #3D数据 #数据升维
↓ 1~2 个数量级 数据成本,对比实采+重建模式
360° 单目视频转动态全量 3D 场景
1 亿 场景数据目标,空间智能 ChatGPT 时刻的临界规模

30 秒速览

  • 核心判断:3D 数据是空间智能的第一性问题,而互联网上已有的海量 2D 视频,是唯一够到互联网量级的数据来源。
  • 数据策略:采集像「伐木挖石油」,转制像「太阳能」——金字塔底层必须是最大量、最低成本的互联网转制数据。
  • 技术进展:单目视频转 360° 动态 3D 场景已技术可行,今年将批量转制,成本比实采至少降 1~2 个数量级。
  • 架构优势:3D 表征让 Token 数量降 1~2 个数量级,因此几十张卡就能训练,不需要万卡集群。
  • 产品矩阵:基础模型 InSpatio-World + 具身仿真 Topos Pro + 轻量生成 Topos Lite(已开源)。

01为什么 3D 数据是「第一性问题」

语言模型和视频模型的成长,都建立在互联网三十年的积累上。而这一次,世界模型的牌桌上,没有任何一家公司的数据够到训练基础模型所需的量级

行业不是没有努力。遥操作、第一人称、相机阵列……具身公司都在重金投入采集。但这些方式在章国锋看来,像伐木和挖石油——有价值,却需要时间积累,耗时耗力。

真正能支撑空间智能的数据能源,应该像阳光一样,无处不在、取之不竭。

采集模式:伐木 & 挖石油

遥操、Egocentric、仿真数据。需要持续投入人和设备,成本高、速度慢、多样性有限,很难做到真正 Scaling。

转制模式:太阳能

互联网上几十亿人花几十年积累的图像视频,每一帧都藏着运动与物理规律。关键是把它「照进来、利用起来」。

注:两种模式并非互斥,而是构成「数据金字塔」的不同层级——底层必须最大量、最低成本;顶层少量高价值数据可用更高成本获得。

底层 · 互联网转制
量级最大 · 成本最低 · 达到互联网级别
中层 · 仿真/合成
多样性补充 · 成本适中
顶层 · 实采数据
高清晰度 · 高价值 · 少量

数据金字塔结构:和语言模型预训练/Post-training 的成本结构类似——最大量用最低成本获取,少量专家数据可以很贵,组合起来训练体系才可持续。

02「太阳能板」:把视频阳光变成 3D 能量

视频的每一帧里,都藏着这个世界的运动、物理的规律。3D 数据一直都在,只是从没有人能把它取出来。影溯要做的事,就是造一块「太阳能板」——把海量视频数据转化成能直接训练世界模型的 3D 数据。

从普通视频出发,生成时空一致的不同视角,再进一步恢复成完整的 4D 场景。只要这个过程的效率足够高,单位数据的成本就可以持续往下降。

「我们的目标不是把某一个 4D 场景做得多便宜,而是最终让大规模生产 3D、4D 数据这件事,在经济上真正成立。」

实采 + 重建

成本高 · 速度慢

相机阵列拍摄 → 重建 4D 场景。动态场景成本极高,且局部不完整——「够重建用,不够生成用」。

互联网视频转制

↓ 1~2 个数量级

无额外采集成本。单目视频 → 360° 动态全量 3D 场景,技术可行,正在批量转制。

判断一个数据策略是否可行的标准其实很简单:它必须能够 Scale,且必须足够多样。只有数据真正 Scale 起来,空间智能才有机会涌现。

注:多样性是关键——「模型如果每天看到的都是差不多的房间、差不多的动作,即使小时数很多,也不一定能涌现出通用能力。」

03已落地的三块「积木」

过去一年,影溯发布的东西分两块:一个基础模型 InSpatio-World,一个引擎平台 Topos(分 Pro 和 Lite)。它们分别回应「让空间走进动态视频」「服务具身训练仿真」「让 3D 变轻、变好玩」三个问题。

🎬 InSpatio-World 基础模型

  • 输入一段视频,你就可以走进这个动态的场景里,自由视角观看。
  • 3 月发布时还做不到真正 360°,偏离视角过大会出现幻觉;改进版将开放更大活动自由度,并直接开放给用户上传视频体验。
定位:「如何让空间走进动态视频」——世界模型的数据引擎。

🛠️ Topos Pro 具身仿真

  • 对标 Marble:用一张或几张图像生成 3D 场景。但不止生成连成一片的高斯场景,还会把物体自动识别、分割、实例化,并赋予物理属性。
  • 机器人面对的将不再是「一整块只能看的 3D 画面」,而是桌子、杯子、椅子等可单独编辑和操作的对象,可接入物理引擎设计抓取、搬运、避障任务。
  • 可以把互联网上大量多样图像批量转成 3D 场景,形成「失败 → 针对性生成更多类似场景 → 继续训练」的数据闭环
定位:服务具身训练仿真,解决「换一个环境、换一个物体之后还能不能工作」的泛化问题。

📱 Topos Lite 轻量 · 已开源

  • 用户随意拍几张照片,秒级生成一个 3D 场景——以前要小心翼翼拍视频、在云端等 10 分钟,现在所见即所得。
  • 如果效率足够高、成本足够低,甚至能在手机端侧运行,3D 内容的生产方式会被彻底改变——「跟今天拍照、拍视频一样简单」。
  • 模型和技术报告已开源,并附带 App 让普通用户直接体验。
定位:降低 3D 数据生产成本这条路线上的成果,探索「3D 普及」的轻量化路径。

04为什么几十张卡就能训练

架构创新最根本的一点,是表征选在哪一层——这直接决定训练的账怎么算。

视频数据里,相邻两帧之间大量信息重复——同一个场景,视角或物体动了一点,每一帧都要把整个画面重新表达一遍。而换到 3D 表征,场景本身只需要表达一次,变化的只是状态。

结果是:Token 数量少 1~2 个数量级,数据量、参数量同步下降。所以我们现在是几十张卡在训练,不需要万卡集群。这不是省着用,是这条路线的账本身就是这么算的。

注:内部实验里,只是把 3D 结构引入模型,学习效率就能提升一个数量级以上,不同下游任务均有明显效果。「三维世界的问题,本来就应该尽量在三维空间里解决。」

两条路线在探索:一条把 Transformer 往三维适配;另一条更激进——跳出 Next Token Prediction 范式本身去想问题。方法可以变,三维结构不能丢。

05物理世界的 ChatGPT 时刻,会以什么迹象到来

ChatGPT 的时刻,不是 AI 突然变成 AGI,而是普通人第一次直接感受到:原来机器真的可以听懂我说话。空间智能也会有类似的时刻——不是等机器人什么都会做,而是有一天大家第一次直观发现:原来机器真的开始理解空间了。

这个信号可能先出现在数字世界。

1

数字世界:一句话生成可交互的 3D 世界

今天做一个 3D 世界还需要建模、材质、动画等专业环节;未来一句话、几张图,就能给你一个完整的、可以走进去、可以交互的三维世界

2

物理世界:真正「聪明起来」的机器

更聪明的扫地机器人,不只按规则运行,而是真正理解这个房间,自然规避 Corner Case;自动驾驶开始处理以前没见过的复杂情况。

3

范式转变:一个足够直观好用的产品

ChatGPT 出来时也没解决所有智能问题,但大家知道范式变了。空间智能也一样——只要出现一个足够直观的产品,让大家第一次感受到机器真的能理解三维世界,那个时刻就已经开始了

章国锋的规划里,最终需要几千万到 1 亿量级的场景数据,才有机会看到空间智能真正的 ChatGPT 时刻。这一轮大模型已经积累了 Scaling 的经验,「一旦数据问题被解决,速度可能比我们预想得更快」。

编辑核心判断

空间智能的竞争,正在从「模型架构比拼」转向「数据生产机制的竞争」。谁能让 3D 数据的边际成本降到互联网量级,谁就握住了通往通用空间智能的钥匙——这个窗口期不是以模型版本计,而是以数据飞轮能否转起来计。

现在就能体验

Topos Lite 已开源;App 已上线,拍几张照片即可秒级生成 3D 场景。今年将开放 InSpatio-World 改进版,支持单目视频转 360° 动态场景。

Topos Lite 开源仓库 → 体验轻量 3D 生成