智在无界发布 Being-H0.8,全球首个隐式触觉世界动作模型登场
7 月 28 日,北大副教授卢宗青创立的智在无界(BeingBeyond)正式发布 Being-H0.8。这是全球首个 隐式触觉世界动作模型,首次将触觉模态纳入大规模模型预训练,并在同一隐空间内统一视觉、触觉、动作与未来状态预测。
7 月 28 日,北大副教授卢宗青创立的智在无界(BeingBeyond)正式发布 Being-H0.8。这是全球首个 隐式触觉世界动作模型,首次将触觉模态纳入大规模模型预训练,并在同一隐空间内统一视觉、触觉、动作与未来状态预测。
过去大半年,具身智能最热闹的画面是“生成一段丝滑的操作视频”。但卢宗青的路线完全相反——不生成画面,直接预测动作与物理响应。
7 月 28 日发布的 Being-H0.8,把这条路线的最新答案摆到了台前。
为什么把赌注押在隐空间上?卢宗青没有绕圈子,直接给出两个可量化的理由。
预测每一个像素。大型视频生成模型的预训练需要数万张卡、数月时间,整体成本数亿元。
真机侧:推理速度跟不上实时决策。球飞过来的轨迹还没生成完,接球时机已经错过。
直接预测 embedding 状态与动作。相同数据量和参数量下,训练成本约为像素生成模型的 1%,差了两个数量级。
真机侧:推理速度足以支撑实时控制,并且有机会学到更本质的物理因果关系。
注:1% 指同等数据与参数规模下、仅算力层面的预训练成本对比,实际差异会因模型结构而变动。但这条路线有一个不可回避的短板——没有画面可以展示。
“演示和落地是两回事。一个接不住球的机器人,画面再好看也没用。”卢宗青对劣势并不回避。
这句话,值得每个正在看 demo 的人停下来想一想。
任何模型路线的上限,都由数据供应决定。2023 年 11 月,卢宗青就提出过一个判断:人类第一视角视频,是具身智能唯一可以大规模 scale up 的数据路径。
这个判断到今天的落点,是超过 50 万小时 的已积累数据。为什么只能选人类视频?因为候选数据源里,只有它同时满足三个条件:
数采场能搭建的场景有限,仿真环境要工程师一个个手动构建;人类真实视频覆盖的日常场景复杂度高出一个量级。
人类日常视频近乎无限;真机数据受硬件、场地和时间制约,规模上限清晰可见。
不绑定特定机器人构型,可跨本体持续复用——通用基础模型需要这种形态无关的数据。
注:三条标准的底色只有一个——“通用”。如果目标只是单场景演示,真机采集的闭环数据确实够用;想要通向通用模型,数据源就必须从第一天开始与形态解耦。
但卢宗青对行业流行的“数据飞轮”浇了一盆冷水。
“如果目标是通用基础模型,创业公司自己做数据飞轮是伪命题。”
同时,50 万小时也并不是一场“时长竞赛”。这套体系还包括标注、筛选、数据对齐、评测、数据管理——智在无界已完成从数据管线、模型预训练、后训练到端侧部署的全栈基础设施建设。
卢宗青的原话更直接:“重复数据对我们来讲没有意义。”
被问到行业整体节奏,卢宗青给出一个不太像创始人的回答——两段式时间表,外加一句清醒的补白。
出现真正商业价值的落地:能算 ROI、真实产生商业价值的场景,而不是为冲业绩或上市讲故事。
类似 GPT-3.5 阶段的具身基础模型:不同形态、不同场景下完成各种任务,无需大量场景适配。家庭机器人由此成为可能。
“GPT 能堆起来,是因为先有了 Transformer 和 Next Token Prediction——有了确定性范式,堆数据才有意义。具身现在连确定性技术是什么都不知道。世界模型可能都不是。”这不是自谦,是判断。
注:这份时间表隐含一个前提——未来三到五年,训练方法和算法本身需要出现突破,而不是单纯把数据和算力堆到某个量级就自动出结果。
具身智能的商业化,很可能从“看不见”的模型里最先跑通。视频生成路线花几个亿预训练,却扛不住实时推理;隐空间路线用 1% 的成本,把世界模型装进端侧。两个数量级的成本差,本身就是完整的商业逻辑。但这部机器有另一面:这条路线至今没有大规模商业验证,它最大的短板——没有画面——恰恰是在融资市场上最容易被打折的理由。行业如果只追逐能展示的 demo,可能会错过更接近物理本质的那条路。
未来两年是验证隐空间路线商业价值的窗口期。关注 Being-H0.8 发布后的接入动作,以及它能否在真实场景中跑出 ROI。
跟踪路线,而非跟风 demo