🤖 具身智能 · 数据底座

3 万小时触觉数据开源,具身智能补齐「最后一厘米」

新智具身(NeoteAI)联合复旦大学可信具身智能研究院发布 N0 系列三份技术报告,首次将触觉从「辅助模态」跃升为「核心基建」:一套3 万小时跨设备触觉语料库,外加两条技术路线——触觉预判 VLA 与触觉世界模型,数据与模型全量开源

来源:公开报道 2026-07-26 全文约 4 分钟读完
#具身智能 #触觉感知 #N0系列 #开源数据集
3 万小时 视觉-触觉交互操作数据总量
100亿帧 触觉图像,对应 80 亿帧 RGB
450 真实长程任务,6 种机器人本体

⚡ 30 秒速览

  • 痛点:摄像头能确认位置,却无法感知「是否接触」「夹力过载」「发生滑移」——视觉无误、物理翻车,是阻碍具身智能跨越「最后一厘米」的核心原因。
  • N0-Foundation:统一各类触觉传感器的「方言」,3 万小时数据 + NeoForce 统一表征模型,让触觉像视觉一样具备 Scaling 潜力。
  • N0-VTLA:不依赖滞后触觉,而是预测未来 50 步触觉演变。插插头成功率从 60% 跃升至 85%。
  • N0-TWAM:把触觉塞进世界模型,同时预测视频、触觉、动作三序列;仿真成功率 84.5%,基线仅 36%。
  • 去哪看:数据与模型已开源,research.neoteai.com 可查。

01为什么视觉 alone 不够用

插头边缘反复摩擦却难以插入、塑料瓶被捏瘪、叠好的毛巾松手即散——这些「视觉判定无误、物理瞬间翻车」的失败,指向一个行业共识:

纯视觉方案

能确认空间位置,却无法感知接触、边缘顶撞、夹力过载或滑移。触觉信号仅在物理接触瞬间产生高频响应,大部分时间「静默」,极易被海量视觉 Token 淹没。

N0 系列方案

把触觉从辅助模态提升为核心基建:用统一表征打破传感器方言,用预判机制消除滞后,用世界模型让机器人在动手前先「摸」一遍。

更关键的是,即便模型成功提取当前触觉特征,本质上仍是对已发生动作的滞后反馈——这种「后视镜」式感知,让机器人在动态交互中始终慢半拍。N0 系列的三份报告,正是对这三层困境的逐一下手。

02N0 系列三份报告一张蓝图,三层跃迁

三份报告合起来看,恰好拼出一张蓝图——一套触觉数据底座,搭配两条不同侧重的技术路线

N0-Foundation数据底座
构建 NeoData 数据集,3 万小时、140 万条操作片段、33 亿时间步;提出 NeoForce 统一表征模型,无论底层传感器是凝胶形变图、电容矩阵还是六维力向量,都能学出可迁移的「触觉普通话」。
N0-VTLA预判式 VLA
不依赖滞后的当前触觉,而是预测未来 50 步内的触觉演变,将当前触觉编码为紧凑潜在 Token,结合视觉上下文预判滑移与受力趋势,指导动作模块提前调整
N0-TWAM触觉世界模型
混合专家架构,内置视频、触觉、动作三个异步专家网络,同时预测未来三个相互耦合的序列;总参数 72 亿,仅相当于全宽方案的一半。

03触觉加进来之后,成功率怎么变

N0-VTLA 在两类精细操作任务上,对纯视觉方案形成显著优势:

🔌 插插头 vs 拔钥匙触觉预判

  • 插插头任务:N0-VTLA 成功率 85%,同类纯视觉方案 60%
  • 拔钥匙任务:N0-VTLA 成功率 99%,纯视觉方案仅 35%——差距高达 64 个百分点。
关键机制:预测未来 50 步触觉演变,在滑移、受力发生前提前调整动作。

N0-VTLA 还突破了模仿学习仅依赖专家成功轨迹的局限,让机器人从失败数据中自主进化。进度评估模型能识别任务阶段,甚至识别出「退步」与「救场」等复杂行为:

毛巾折叠
视觉N0-VTLA
50%
95%
书包收纳
视觉N0-VTLA
35%
80%
纸箱折叠
视觉N0-VTLA
20%
75%

注:柱形高度按百分比等比缩放,零起点。结合离线强化学习,从失败经验中持续进化。

04把触觉塞进世界模型

现有世界模型大多局限于未来视觉图像的生成。画面里杯子被抓住了,但手指夹没夹稳?画面里插头对齐了,但下一秒会不会卡住?这些触感信息完全缺失

N0-TWAM 同时预测未来的视频、触觉和动作三个相互耦合的序列——让机器人在动手前,先在自己的「想象」里完整推演一遍操作视角和手感:

84.5%仿真平均成功率
36%最强基线
46.3%真机 8 项任务
21.9%LingBot-VA 基线

消融实验进一步证实:去除「未来触觉预测」或「当前触觉条件」均会导致性能显著下降,确立了触觉在世界模型中不可或缺。

从架构逻辑看,触觉进入机器人认知的链路是这样的:

视觉 + 触觉输入混合专家编码三序列联合预测动作决策

N0-TWAM 的混合专家架构中,视频专家从预训练模型热启动,触觉和动作专家用更窄结构——72 亿参数即实现全宽方案的效果,工程效率显著。

053 万小时怎么来的

触觉数据的规模化应用长期受制于各类触觉设备输出格式互不兼容。不同传感器输出的凝胶形变图、电容矩阵或六维力向量,犹如缺乏统一语法的方言,难以在同一模型中融合。

NeoData 数据集旨在打破这一壁垒,已动用 Franka、Piper、UR5e 等 6 种机器人本体,由 90 位操作员采集 450 项真实长程任务(叠衣、插拔接头、倒液体等):

3 万h视觉-触觉数据
140 万操作片段
33 亿时间步
5 千h已开源数据

对应 80 亿帧 RGB 画面与 100 亿帧触觉图像。已开源 5 千小时视觉-触觉交互操作数据,完整数据集持续释放中。

NeoForce 统一表征模型则解决了跨设备融合难题——无论底层硬件如何,都能学出具备迁移能力、时序结构化的触觉表征:哪里被按?按多大力?有没有横向拉扯?

编辑视角

本篇报道源自企业通稿与官方技术报告,数据为单方披露,暂未见第三方独立复测。读者可带此背景阅读:成功率数字(如拔钥匙 99% vs 35%)为研究团队自测,任务定义、基线选择、测试条件等细节以开源仓库为准。

需要承认的是,距离「随手一摸即知轻重」的通用具身智能仍有距离——真实场景数据采集成本、跨本体泛化能力、推理实时性仍是工程难题。但 N0 系列的实质贡献在于:把触觉从「小众研究方向」推上「核心基建」位置,验证了它具备类似视觉的 Scaling 潜力,并给出了数据、VLA、世界模型三层完整路径。

具身智能的竞争焦点,正从「看懂世界」的视觉单极,转向「视触融合」的双模态——谁先补上触觉这一极,谁就拿到下一代机器人的定义权。

现在就能看

数据集、模型与技术报告均已开源,可逐项复现。

research.neoteai.com → 项目主页