🦾 具身智能 · 技术突破

N0系列报告连发:3万小时触觉数据补齐具身智能"手感",插插头成功率跃升至85%

NeoteAI 联合复旦大学发布 N0 系列三份技术报告,构建超 3 万小时视觉-触觉交互数据底座,并推出两条技术路线攻克物理交互"最后一厘米"。在插插头任务中,N0-VTLA 成功率达 85%,较纯视觉方案提升 25 个百分点。

来源:公开报道 2026-07-26 全文约 4 分钟读完
#具身智能 #触觉感知 #NeoteAI #复旦大学 #开源
3 万小时 视觉-触觉交互数据,已开源 5 千小时
85% 插插头任务成功率(纯视觉 60%)
72亿 N0-TWAM 参数量,约全宽方案一半

⚡ 30 秒速览

  • 痛点在哪:视觉判定无误但物理交互瞬间翻车——插头边缘反复摩擦、抓塑料瓶力道失控、毛巾松手散落。摄像头看不到"是否接触""夹力过载""发生滑移"。
  • 出了什么:N0-Foundation 统一触觉"方言"建 3 万小时语料库;N0-VTLA 以"触觉预判"赋能轻量 VLA;N0-TWAM 在世界模型中重构"触觉想象"。
  • 硬指标:拔钥匙 99% vs 35%,折叠毛巾 50%→95%,真机 8 项任务平均 46.3%(基线 21.9%)。
  • 能不能复现:数据与模型全开源,5 千小时数据已开放下载。
  • 深层信号:触觉正从"辅助模态"升格为具身智能"核心基建",机器人认知从"视觉驱动"向"视触融合"演进。

01从"看得见"到"摸得着" 具身智能的最后一厘米

机器人实操翻车的名场面,大多指向同一根源:视觉系统判定无误,但物理交互瞬间失控。摄像头能确认空间位置,却无法感知"是否接触""顶到边缘""夹力过载"或"发生滑移"——这层反馈的缺失,正是阻碍机器人跨越"最后一厘米"的核心痛点。

纯视觉方案

滞后反馈:触觉信号仅在接触瞬间产生高频响应,大部分时间"静默",易被海量视觉 Token 淹没;即便提取到当前触觉特征,仍是对已发生动作的"后视镜"式感知。

N0 触觉融合方案

预判未来:不依赖滞后的当前触觉,而是预测未来 50 步内的触觉演变,结合视觉上下文预判滑移、受力趋势,指导动作模块提前调整。

NeoteAI 联合复旦大学可信具身智能研究院发布的 N0 系列三份技术报告,恰好拼出一张蓝图:一套触觉数据底座 + 两条不同侧重的技术路线

N0-Foundation 数据底座N0-VTLA 触觉预判N0-TWAM 触觉想象

02N0-Foundation:统一触觉"方言" 3 万小时交互语料库

触觉数据的规模化应用长期受制于各类触觉设备输出格式互不兼容——凝胶形变图、电容矩阵、六维力向量,犹如缺乏统一语法的方言,难以在同一模型中融合。NeoData 数据集要打破的正是这层壁垒:

3 万+小时视触交互数据
140 万条操作片段
33 亿个时间步
450 项真实长程任务
6 种机器人本体
90 位操作员采集
80 亿帧 RGB 画面
100 亿帧触觉图像

已开源 5 千小时视觉-触觉交互操作数据。覆盖叠衣、插拔接头、倒液体等长程任务,使用 Franka、Piper、UR5e 等 6 种机器人本体采集。

配套提出的 NeoForce 统一表征模型,无论底层传感器硬件如何,都能学习到具备迁移能力、时序结构化的触觉表征——哪里被按?按多大力?有没有横向拉扯?这种"触觉普通话"解决了跨设备数据融合难题。

03N0-VTLA:以预判赋能轻量 VLA 从失败中自主进化

N0-VTLA 将当前触觉编码为紧凑的潜在 Token,结合视觉上下文预判滑移、受力等趋势,指导动作模块提前调整——不再是慢半拍的"后视镜",而是看前方的"预判雷达"

🔌 插插头任务:85% vs 60%成功率领先 25 个百分点

  • 触觉预判机制让机器人提前感知接触与阻力变化,不再反复摩擦边缘。

🔑 拔钥匙任务:99% vs 35%成功率领先 64 个百分点

  • 纯视觉方案因无法感知卡扣阻力频繁失败,触觉预判使机器人能感知"顶到边缘"并微调姿态。

更关键的是,N0-VTLA 突破了传统模仿学习仅依赖专家成功轨迹的局限:让机器人从失败数据中实现自主进化。通过结合 human-in-the-loop 数据训练进度评估模型,机器人能识别任务执行阶段,甚至识别"退步"与"救场"等复杂行为。

折叠毛巾结合离线强化学习后
95%
折叠毛巾仅专家成功轨迹
50%
收纳书包结合离线强化学习后
80%
收纳书包仅专家成功轨迹
35%
折叠纸箱结合离线强化学习后
75%
折叠纸箱仅专家成功轨迹
20%

注:柱形以 0-100% 完整刻度呈现,零起点。离线强化学习结合触觉进度评估后,三项长程任务成功率分别提升 45、45、55 个百分点。

04N0-TWAM:在世界模型中重构"触觉想象" 动手前先在脑中推演

现有世界模型大多局限于未来视觉图像生成——画面里杯子被抓住了,但手指夹没夹稳?画面里插头对齐了,但下一秒会不会卡住?触感信息完全缺失。N0-TWAM 同时预测未来的视频、触觉和动作三个相互耦合的序列。

🧠 混合专家架构:72 亿参数约全宽方案一半

  • 内置视频、触觉、动作三个异步专家网络。
  • 视频专家从预训练模型热启动,触觉和动作专家用更窄的结构。
  • 消融实验证实:去除"未来触觉预测"或"当前触觉条件"均会导致性能显著下降。
确立了触觉在世界模型中的不可或缺性
N0-TWAM仿真平均成功率
84.5%
最强基线世界模型
36%
N0-TWAM真机 8 项任务平均
46.3%
LingBot-VA基线方案
21.9%

注:柱形以 0-100% 完整刻度呈现,零起点。仿真环境领先 48.5 个百分点,真机环境领先 24.4 个百分点。

编辑视角

本篇核心数据来自 NeoteAI 与复旦大学的官方发布,属单方披露,目前未见第三方独立复测。建议读者以此为背景理解各项成功率指标:实验室与仿真环境成绩通常高于真实开放场景,跨本体泛化能力与推理实时性仍是公开承认的工程难题。

不过,将触觉从"辅助模态"提升至与视觉平起平坐的"核心基建",并给出数据底座、预判模型、世界模型三层完整技术栈,这一路线本身具有清晰的方法论价值——它意味着具身智能的 Scaling Law 不再仅靠堆视觉参数,多模态物理反馈的融合正在成为新的确定性方向。

触觉数据工程化,是具身智能从"看懂世界"迈向"摸透世界"的必经入口。

项目已开源

3 万小时数据底座与 N0 系列模型已开放,5 千小时视觉-触觉交互数据可直接下载。

research.neoteai.com → 查看完整开源链接