N0系列报告连发:3万小时触觉数据补齐具身智能"手感",插插头成功率跃升至85%
NeoteAI 联合复旦大学发布 N0 系列三份技术报告,构建超 3 万小时视觉-触觉交互数据底座,并推出两条技术路线攻克物理交互"最后一厘米"。在插插头任务中,N0-VTLA 成功率达 85%,较纯视觉方案提升 25 个百分点。
NeoteAI 联合复旦大学发布 N0 系列三份技术报告,构建超 3 万小时视觉-触觉交互数据底座,并推出两条技术路线攻克物理交互"最后一厘米"。在插插头任务中,N0-VTLA 成功率达 85%,较纯视觉方案提升 25 个百分点。
机器人实操翻车的名场面,大多指向同一根源:视觉系统判定无误,但物理交互瞬间失控。摄像头能确认空间位置,却无法感知"是否接触""顶到边缘""夹力过载"或"发生滑移"——这层反馈的缺失,正是阻碍机器人跨越"最后一厘米"的核心痛点。
滞后反馈:触觉信号仅在接触瞬间产生高频响应,大部分时间"静默",易被海量视觉 Token 淹没;即便提取到当前触觉特征,仍是对已发生动作的"后视镜"式感知。
预判未来:不依赖滞后的当前触觉,而是预测未来 50 步内的触觉演变,结合视觉上下文预判滑移、受力趋势,指导动作模块提前调整。
NeoteAI 联合复旦大学可信具身智能研究院发布的 N0 系列三份技术报告,恰好拼出一张蓝图:一套触觉数据底座 + 两条不同侧重的技术路线。
触觉数据的规模化应用长期受制于各类触觉设备输出格式互不兼容——凝胶形变图、电容矩阵、六维力向量,犹如缺乏统一语法的方言,难以在同一模型中融合。NeoData 数据集要打破的正是这层壁垒:
已开源 5 千小时视觉-触觉交互操作数据。覆盖叠衣、插拔接头、倒液体等长程任务,使用 Franka、Piper、UR5e 等 6 种机器人本体采集。
配套提出的 NeoForce 统一表征模型,无论底层传感器硬件如何,都能学习到具备迁移能力、时序结构化的触觉表征——哪里被按?按多大力?有没有横向拉扯?这种"触觉普通话"解决了跨设备数据融合难题。
N0-VTLA 将当前触觉编码为紧凑的潜在 Token,结合视觉上下文预判滑移、受力等趋势,指导动作模块提前调整——不再是慢半拍的"后视镜",而是看前方的"预判雷达"。
更关键的是,N0-VTLA 突破了传统模仿学习仅依赖专家成功轨迹的局限:让机器人从失败数据中实现自主进化。通过结合 human-in-the-loop 数据训练进度评估模型,机器人能识别任务执行阶段,甚至识别"退步"与"救场"等复杂行为。
注:柱形以 0-100% 完整刻度呈现,零起点。离线强化学习结合触觉进度评估后,三项长程任务成功率分别提升 45、45、55 个百分点。
现有世界模型大多局限于未来视觉图像生成——画面里杯子被抓住了,但手指夹没夹稳?画面里插头对齐了,但下一秒会不会卡住?触感信息完全缺失。N0-TWAM 同时预测未来的视频、触觉和动作三个相互耦合的序列。
注:柱形以 0-100% 完整刻度呈现,零起点。仿真环境领先 48.5 个百分点,真机环境领先 24.4 个百分点。
本篇核心数据来自 NeoteAI 与复旦大学的官方发布,属单方披露,目前未见第三方独立复测。建议读者以此为背景理解各项成功率指标:实验室与仿真环境成绩通常高于真实开放场景,跨本体泛化能力与推理实时性仍是公开承认的工程难题。
不过,将触觉从"辅助模态"提升至与视觉平起平坐的"核心基建",并给出数据底座、预判模型、世界模型三层完整技术栈,这一路线本身具有清晰的方法论价值——它意味着具身智能的 Scaling Law 不再仅靠堆视觉参数,多模态物理反馈的融合正在成为新的确定性方向。
3 万小时数据底座与 N0 系列模型已开放,5 千小时视觉-触觉交互数据可直接下载。
research.neoteai.com → 查看完整开源链接