🤖 具身智能 · 架构解读

PULSE 架构:把"错误信念"塞进世界模型,这家公司要让家庭机器人先懂人再干活

星炽动力 CTO 李达披露 PULSE 架构:把"用户状态"与"物理环境"并列为世界模型的双轨推演对象,用"信念、意图、偏好"三维度建模人——核心判断是,物理智能短期内难以泛化,但单户家庭内的人是有规律的,先把"这一户人"读懂,比追求万能工具更接近落地

来源:企业访谈 全文约 5 分钟读完
#星炽动力 #PULSE架构 #具身智能 #心智理论
双轨 物理环境 + 用户状态 并行推演
3 信念 · 意图 · 偏好 建模人
3 记忆架构:规则 / RAG / 参数化

⚡ 30 秒速览

  • 核心反共识:行业死磕物理智能,PULSE 选择先把"人"放进世界模型——理由是物理泛化短期无解,但单户家庭里人的行为有迹可循。
  • 双轨是什么:一条轨算"杯子会不会掉",另一条轨算"这个动作会不会打扰主人",两条轨在特征层做交叉验证后输出决策。
  • 最妙的例子:男主人以为牛奶还在微波炉(错误信念),机器人识别信息差后主动提醒——这是"心智理论"首次被显式塞进具身大脑。
  • 落地策略:端侧做测试时适应(TTA),每个家庭的机器人在本地长出自己的理解模型,不必等云端回传。
  • 隐私原生:RGB 在端侧就转成骨架点,云端只拿到"高兴""疲惫"这类语义标签和拓扑图。

01双轨世界模型 把"人怎么了"和"环境怎么了"平权

当前具身行业的世界模型主流做法是推演环境动力学——周围物理环境怎么变。PULSE 的核心反共识是:家庭场景里人不是一件物体,而是交互中心,用户状态的变化必须被同步推演

传统单轨世界模型

只推演物理环境:杯子在哪、会不会掉、能不能抓。机器人认知里只有桌子、沙发,没有"坐在沙发上的人"。

PULSE 双轨世界模型

物理轨 + 用户轨并行,在特征层交叉验证。行动前不仅算"杯子会不会掉",还算"这举动会不会打扰主人"。

用户状态被表征为隐空间的特征向量,以类似 token 的形式参与跨注意力计算,和环境特征做对齐——这是技术选型上的明确价值判断:理解人和理解物理世界,在认知架构上平权,甚至人的优先级更高。

看懂环境理解用户双轨推演接受反馈持续进化

PULSE 闭环五步,名字取"脉搏"之意——机器人有了脉搏,才算有了生命。

02怎么读懂人?信念 · 意图 · 偏好

PULSE 把"心智理论(ToM)"转化为可计算、可训练、可验证的数学模型,锚定三个维度:

🥛 信念(Belief)——识别人的"错误前提"认知纠偏

  • 男主人把牛奶放进微波炉后离开,女主人取出。男主人持有一个"牛奶还在微波炉里"的虚假信念
  • 只盯物理世界的机器人看到微波炉没牛奶,无法理解男主人接下来要做什么;具备信念表征的机器人会主动出声:"牛奶已经被拿出来了",甚至直接递上牛奶。
技术落点:用户状态作为隐空间特征向量,以 token 形式接入世界动作模型的条件化输入。

🎯 意图(Intention)——"眼里有活"主动预判

  • 不再满足于听懂直接指令,要求机器人通过用户行为动作提前推断潜在需求
  • 结合"偏好对齐"评估执行分寸——不确定时主动询问:"我帮您把这件事做了,行不行?"用户不耐烦就静默处理。
底层支撑:基于自解释增强的多模态大模型做用户状态表征建模。

🏠 偏好(Preference)——长期情境记忆持续积累

  • 涉及用户习惯、边界、隐私,靠持续交互积累,沉淀为长期情境记忆。
  • 用户的多模态显隐式反馈(愤怒微表情、不耐烦语气、竖大拇指夸"你真棒")回传后,转化为偏好对齐模型的正负奖励

03三层记忆架构 兼顾低延迟与深度理解

一句"帮我倒杯水"隐含水温、杯子、纯净水还是电解质水等海量决策分支。PULSE 设计了自适应任务复杂度的三层记忆:

结构化规则层高确定性
处理物理时空精准检索。用户问"我的剪刀呢?"——直接在规则记忆库调用,无需激活底层模型。
触发条件:精准匹配的寻物指令
RAG 语义层模糊意图
从过往交互切片中检索语境与习惯。"帮我倒杯水"——RAG 检索出用什么杯子、常喝温度,对齐当前意图。
触发条件:模糊或高度意图化的指令
参数化模型层长尾 / Zero-shot
大模型认知推理与泛化。面对无历史规则可循的突发状况,对长期沉淀的用户行为做因果归因与价值挖掘。
触发条件:长尾场景、深层情感共鸣、突发状况

层层递进的设计目标:既能"极速响应",又能"深思熟虑"。

04为什么是"先懂人"而不是"先通物理"?

李达给了一个非常务实的判断:物理世界的泛化,短期内难以实现。

"一个在 80 公分高的桌子上训练好的抓取模型,换到 75 公分的桌子上就可能失效。"如果只在实验室闭门造车死磕算法,永远穷举不完真实家庭里千奇百怪的参数。 —— 李达,星炽动力 CTO

但人的理解模型不一样。虽然人也复杂,但人的行为在单个家庭里是有规律的——每天喝水的杯子、回家时间、说话语气都有迹可循。先在"这一户人"里把人理解清楚,可用性迅速提升,使用频率上升,真机数据反哺具身大脑,飞轮转起来。

端云结合策略也印证这一点:云端负责全局迭代,端侧跑测试时适应(TTA)。机器人在使用中遇到新分布的数据,直接在本地做调优,不用等云端回传——每个家庭的机器人都长出自己的理解模型。

物理智能解决"能不能做到",人的理解模型解决"该不该做、什么时候做、怎么做才合适"——在容错率极低的家庭场景里,后者优先级恐怕还要再往前排。

05隐私即设计 不是合规补丁,是架构原生

PULSE 把隐私保护直接写进架构(Privacy by Design),通过端侧计算和模态解耦切断泄露源头:

视觉脱敏

RGB 高清画面在端侧转为骨架点信息,衣着纹理、背景光影作为噪声剥离,行为识别反而更鲁棒

敏感前置

人脸微表情、生理状态在前端直接闭环,云端只收到"高兴""疲惫"等结构化语义标签

场景语义化

不上传家庭照片,只提取语义场景图——一组描述物体空间关系的文本和拓扑图。

目前已与海尔智家、涂鸦智能深度打通,机器人可自主指令空调下调温度——态势感知不仅服务决策,也联动全屋智能生态。

▸ 编辑视角

本文素材来自企业方访谈,CTO 单方披露架构思路,未见第三方独立复测或同行评审。"错误信念"建模、双轨世界模型等提法目前停留在工程描述层面,没有公开的基准评测或可复现的代码仓库。读者宜将其视为一家公司对"家庭机器人该怎么造"的路线表态,而非已验证的技术结论。

值得留意的支线:李达师从谭铁牛院士,长期做视觉导航与连续学习,学术底子扎实——"连续学习"与"灾难性遗忘"的工程权衡,是他访谈中少有的坦率承认"现有大模型架构里概率极高"的风险点,这比"我们已经解决"的通稿式表述可信得多。

家庭机器人赛道正从"比谁手更稳"切到"比谁更懂察言观色"——这条路线能否跑通,不取决于某家公司的架构巧思,而取决于"读懂一户人"所需的数据沉淀周期,能否跑赢投资人的耐心。

关注与跟踪

星炽动力聚焦 C 端家庭场景,PULSE 架构仍在工程推进中。Mission:让机器人真正走进千家万户,打造在长期陪伴中不断学习、越来越懂你的家庭伙伴机器人。

星炽动力 → 持续跟踪产品落地