🔬 具身智能 · 技术路线

智在无界发布 Being-H0.8,全球首个隐式触觉世界动作模型登场

7 月 28 日,北大副教授卢宗青创立的智在无界(BeingBeyond)正式发布 Being-H0.8。这是全球首个 隐式触觉世界动作模型,首次将触觉模态纳入大规模模型预训练,并在同一隐空间内统一视觉、触觉、动作与未来状态预测。

综合公开信息整理 2026-07-30 全文约 4 分钟读完
#具身智能 #世界模型 #隐空间 #触觉感知
全球首个 隐式触觉世界动作模型 · Being-H0.8
50万+ 人类第一视角视频数据小时数
≈1% 视频生成路线的预训练成本

⚡ 30 秒速览

  • 事件:7 月 28 日发布 Being-H0.8,全球首个隐式触觉世界动作模型,首次将触觉模态纳入大规模预训练。
  • 路线:不生成画面,直接在隐空间预测动作与物理响应;训练成本约为视频生成路线的 1%,推理速度足以支撑实时控制。
  • 数据:已积累超过 50 万小时 人类第一视角视频,按多样性和质量逐条筛选,不以时长堆量。
  • 判断:创业公司自建数据飞轮去追通用模型是伪命题——最大受益者是平台公司,通用模型需要形态无关的数据。
  • 节奏:两到三年出现算得清 ROI 的落地;三到五年冲击具身基础模型的 GPT-3.5 时刻。但确定性技术尚未出现。

01Being-H0.8 是什么?不生成画面,却知道世界如何变化

过去大半年,具身智能最热闹的画面是“生成一段丝滑的操作视频”。但卢宗青的路线完全相反——不生成画面,直接预测动作与物理响应

7 月 28 日发布的 Being-H0.8,把这条路线的最新答案摆到了台前。

🧠 Being-H0.8 的核心能力 全球首个

  • 触觉入模:首次将触觉模态引入大规模模型预训练,模型不仅理解“看到了什么、做了什么”,还能预测“接触之后世界如何变化”。
  • 统一隐空间:视觉、触觉、动作与未来状态预测被放进同一 embedding 空间,不渲染像素,直接学习物理交互的底层结构。
  • 跨本体泛化:在一种构型上微调后,不同形态的机器人也能做出类似动作——这是预训练模型带来的价值。
  • 端侧可部署:与地瓜机器人合作推进端侧世界模型部署,直接面向本体厂商交付能力。
在卢宗青的定义里,1.0 意味着“真正完善、通用的具身基础模型”。H0.8 被他视为通向 1.0 的重要节点——从理解交互,到预测交互

02路线之争:隐空间 vs 视频生成

为什么把赌注押在隐空间上?卢宗青没有绕圈子,直接给出两个可量化的理由。

视频生成路线

预测每一个像素。大型视频生成模型的预训练需要数万张卡、数月时间,整体成本数亿元

真机侧:推理速度跟不上实时决策。球飞过来的轨迹还没生成完,接球时机已经错过。

隐空间路线

直接预测 embedding 状态与动作。相同数据量和参数量下,训练成本约为像素生成模型的 1%,差了两个数量级。

真机侧:推理速度足以支撑实时控制,并且有机会学到更本质的物理因果关系。

1%预训练成本
100×成本差距
实时推理可支撑控制
无画面展示环节吃亏

注:1% 指同等数据与参数规模下、仅算力层面的预训练成本对比,实际差异会因模型结构而变动。但这条路线有一个不可回避的短板——没有画面可以展示。

“演示和落地是两回事。一个接不住球的机器人,画面再好看也没用。”卢宗青对劣势并不回避。

这句话,值得每个正在看 demo 的人停下来想一想。

0350 万小时的“第一视角”赌注

任何模型路线的上限,都由数据供应决定。2023 年 11 月,卢宗青就提出过一个判断:人类第一视角视频,是具身智能唯一可以大规模 scale up 的数据路径

这个判断到今天的落点,是超过 50 万小时 的已积累数据。为什么只能选人类视频?因为候选数据源里,只有它同时满足三个条件:

1多样性

数采场能搭建的场景有限,仿真环境要工程师一个个手动构建;人类真实视频覆盖的日常场景复杂度高出一个量级。

2规模

人类日常视频近乎无限;真机数据受硬件、场地和时间制约,规模上限清晰可见。

3可扩展

不绑定特定机器人构型,可跨本体持续复用——通用基础模型需要这种形态无关的数据。

注:三条标准的底色只有一个——“通用”。如果目标只是单场景演示,真机采集的闭环数据确实够用;想要通向通用模型,数据源就必须从第一天开始与形态解耦。

但卢宗青对行业流行的“数据飞轮”浇了一盆冷水。

“如果目标是通用基础模型,创业公司自己做数据飞轮是伪命题。”

为什么数据飞轮对创业公司不成立

  • 受益方错位:数据飞轮的最大优势方是平台公司,不是创业公司。
  • 构型耦合:创业公司铺量采集,数据会快速 overfit 自己的本体构型,短时间无法 scale up。
  • 天花板可见:只靠自家本体闭环数据做垂直场景可行,但通向通用模型的天花板清晰可见。

同时,50 万小时也并不是一场“时长竞赛”。这套体系还包括标注、筛选、数据对齐、评测、数据管理——智在无界已完成从数据管线、模型预训练、后训练到端侧部署的全栈基础设施建设。

卢宗青的原话更直接:“重复数据对我们来讲没有意义。”

04节奏:具身智能的 GPT-3.5 时刻

被问到行业整体节奏,卢宗青给出一个不太像创始人的回答——两段式时间表,外加一句清醒的补白。

01
现在 → 2 年

出现真正商业价值的落地:能算 ROI、真实产生商业价值的场景,而不是为冲业绩或上市讲故事。

02
3 → 5 年

类似 GPT-3.5 阶段的具身基础模型:不同形态、不同场景下完成各种任务,无需大量场景适配。家庭机器人由此成为可能。

?
前提:确定性技术尚未出现

“GPT 能堆起来,是因为先有了 Transformer 和 Next Token Prediction——有了确定性范式,堆数据才有意义。具身现在连确定性技术是什么都不知道。世界模型可能都不是。”这不是自谦,是判断。

注:这份时间表隐含一个前提——未来三到五年,训练方法和算法本身需要出现突破,而不是单纯把数据和算力堆到某个量级就自动出结果。

编辑核心判断

具身智能的商业化,很可能从“看不见”的模型里最先跑通。视频生成路线花几个亿预训练,却扛不住实时推理;隐空间路线用 1% 的成本,把世界模型装进端侧。两个数量级的成本差,本身就是完整的商业逻辑。但这部机器有另一面:这条路线至今没有大规模商业验证,它最大的短板——没有画面——恰恰是在融资市场上最容易被打折的理由。行业如果只追逐能展示的 demo,可能会错过更接近物理本质的那条路。

接下来看什么

未来两年是验证隐空间路线商业价值的窗口期。关注 Being-H0.8 发布后的接入动作,以及它能否在真实场景中跑出 ROI。

跟踪路线,而非跟风 demo