3 万小时触觉数据开源,具身智能补齐「最后一厘米」
新智具身(NeoteAI)联合复旦大学可信具身智能研究院发布 N0 系列三份技术报告,首次将触觉从「辅助模态」跃升为「核心基建」:一套3 万小时跨设备触觉语料库,外加两条技术路线——触觉预判 VLA 与触觉世界模型,数据与模型全量开源。
新智具身(NeoteAI)联合复旦大学可信具身智能研究院发布 N0 系列三份技术报告,首次将触觉从「辅助模态」跃升为「核心基建」:一套3 万小时跨设备触觉语料库,外加两条技术路线——触觉预判 VLA 与触觉世界模型,数据与模型全量开源。
插头边缘反复摩擦却难以插入、塑料瓶被捏瘪、叠好的毛巾松手即散——这些「视觉判定无误、物理瞬间翻车」的失败,指向一个行业共识:
能确认空间位置,却无法感知接触、边缘顶撞、夹力过载或滑移。触觉信号仅在物理接触瞬间产生高频响应,大部分时间「静默」,极易被海量视觉 Token 淹没。
把触觉从辅助模态提升为核心基建:用统一表征打破传感器方言,用预判机制消除滞后,用世界模型让机器人在动手前先「摸」一遍。
更关键的是,即便模型成功提取当前触觉特征,本质上仍是对已发生动作的滞后反馈——这种「后视镜」式感知,让机器人在动态交互中始终慢半拍。N0 系列的三份报告,正是对这三层困境的逐一下手。
三份报告合起来看,恰好拼出一张蓝图——一套触觉数据底座,搭配两条不同侧重的技术路线:
N0-VTLA 在两类精细操作任务上,对纯视觉方案形成显著优势:
N0-VTLA 还突破了模仿学习仅依赖专家成功轨迹的局限,让机器人从失败数据中自主进化。进度评估模型能识别任务阶段,甚至识别出「退步」与「救场」等复杂行为:
注:柱形高度按百分比等比缩放,零起点。结合离线强化学习,从失败经验中持续进化。
现有世界模型大多局限于未来视觉图像的生成。画面里杯子被抓住了,但手指夹没夹稳?画面里插头对齐了,但下一秒会不会卡住?这些触感信息完全缺失。
N0-TWAM 同时预测未来的视频、触觉和动作三个相互耦合的序列——让机器人在动手前,先在自己的「想象」里完整推演一遍操作视角和手感:
消融实验进一步证实:去除「未来触觉预测」或「当前触觉条件」均会导致性能显著下降,确立了触觉在世界模型中不可或缺。
从架构逻辑看,触觉进入机器人认知的链路是这样的:
N0-TWAM 的混合专家架构中,视频专家从预训练模型热启动,触觉和动作专家用更窄结构——72 亿参数即实现全宽方案的效果,工程效率显著。
触觉数据的规模化应用长期受制于各类触觉设备输出格式互不兼容。不同传感器输出的凝胶形变图、电容矩阵或六维力向量,犹如缺乏统一语法的方言,难以在同一模型中融合。
NeoData 数据集旨在打破这一壁垒,已动用 Franka、Piper、UR5e 等 6 种机器人本体,由 90 位操作员采集 450 项真实长程任务(叠衣、插拔接头、倒液体等):
对应 80 亿帧 RGB 画面与 100 亿帧触觉图像。已开源 5 千小时视觉-触觉交互操作数据,完整数据集持续释放中。
NeoForce 统一表征模型则解决了跨设备融合难题——无论底层硬件如何,都能学出具备迁移能力、时序结构化的触觉表征:哪里被按?按多大力?有没有横向拉扯?
本篇报道源自企业通稿与官方技术报告,数据为单方披露,暂未见第三方独立复测。读者可带此背景阅读:成功率数字(如拔钥匙 99% vs 35%)为研究团队自测,任务定义、基线选择、测试条件等细节以开源仓库为准。
需要承认的是,距离「随手一摸即知轻重」的通用具身智能仍有距离——真实场景数据采集成本、跨本体泛化能力、推理实时性仍是工程难题。但 N0 系列的实质贡献在于:把触觉从「小众研究方向」推上「核心基建」位置,验证了它具备类似视觉的 Scaling 潜力,并给出了数据、VLA、世界模型三层完整路径。
具身智能的竞争焦点,正从「看懂世界」的视觉单极,转向「视触融合」的双模态——谁先补上触觉这一极,谁就拿到下一代机器人的定义权。
数据集、模型与技术报告均已开源,可逐项复现。
research.neoteai.com → 项目主页