🤖 AI 研究平台 · 技术突破

AI 科学家零漂移研究循环登顶 NavigationBench,四足导航任务超越人类基线

arXivLabs 推出的 AI Scientist 框架,以92.3% 综合得分登顶 NavigationBench v3,在四足机器人导航研究中实现完全可证伪的闭环发现,成为首个在长周期自主研究中保持零漂移的 AI 系统。

来源:综合公开信息整理 2026-07-22 全文约 3 分钟读完
#arXivLabs #AI Scientist #四足导航 #可证伪发现
🥇 第 1 名 NavigationBench v3 · 38 个参评系统
92.3% 综合得分,领先第二名 7.8 个百分点
0 漂移次数,1000 步长周期研究

⚡ 30 秒速览

  • 赢了多少:在 NavigationBench v3 上超越 Google RT-2-X(84.5%)、Meta AdaptiveNav(81.2%)、OpenAI 基础 Agent(79.1%)登顶。
  • 硬核在哪:评测包含 147 个四足导航场景,要求 AI 自主完成从感知到决策的全链路,并用「可证伪性」标准自动校验每个发现。
  • 敢不敢验:arXivLabs 已开源全部评测流程与 1000 步研究日志,每一步的决策依据、失败记录、修正逻辑全量可追溯。
  • 深层信号:「品味」与「结构」成为 AI 研究的关键词——系统不再只是堆算力,而是学会了如何做科研。
  • 去哪体验:arXivLabs 平台已开放 AI Scientist 测试接口,研究者可提交自定义导航任务。

01NavigationBench 榜单 AI Scientist 高居榜首

🥇 AI ScientistarXivLabs
92.3
RT-2-XGoogle DeepMind
84.5
AdaptiveNavMeta AI
81.2
基础 AgentOpenAI
79.1
随机搜索基线启发式
68.3

注:柱形自 60 分起缩放,非零起点;分差以标注分数为准。榜首与第二名分差 7.8 个百分点,与随机基线分差 24 个百分点。

02「不漂移」的 AI 科学家:到底解决了什么?

传统 AI 研究系统在长周期任务中会逐渐偏移——起初逻辑正确,100 步后开始重复错误,300 步后完全偏离目标。arXivLabs 的突破在于引入了 「品味」与「结构」双约束

这套机制让 AI 在四足导航研究中,从感知地形到生成新策略,每一步都保持可证伪性。

传统 AI 研究循环

黑箱探索 → 结果漂移 → 人工介入纠正 → 效率低下,无法自主长跑。

AI Scientist 循环

假设生成 → 结构化验证 → 自动纠错 → 可证伪发现,全程零人工干预。

具体到 NavigationBench 的评测,AI Scientist 在 1000 步连续研究中,从未离开过「可验证」轨道——这是它拿下高分的关键。

03它真的会做研究?三个完整发现案例

🧭 地形感知:碎石坡道的最优步态发现可证伪验证通过

  • 假设生成:在 15° 碎石坡道上,增大腿部阻尼系数可减少 22% 侧滑。
  • 结构化验证:在 47 组仿真实验中,改变阻尼值并记录侧滑数据,P 值 < 0.01。
  • 结论交付:输出完整的参数化策略文件,并附上失败案例的反思记录。
评审结论:「假设可证伪,实验可复现,满足科研标准」

🦿 能量优化:动态步频调整策略零漂移记录

  • 发现固定步频在高负载时能耗浪费 18%,提出自适应步频模型。
  • 用 120 组对比实验验证,在 9 种负载条件下均优于基线。
  • 系统自动生成科研报告,包含图表、置信区间和失败边界。
LLM 评审:「结论具有普适性,实验设计无逻辑漏洞」

🧪 多足协同:非对称步态的新发现反直觉结果

  • 传统观点认为对称步态能耗最低,AI Scientist 发现非对称步态在崎岖地形反而效率高 7%。
  • 通过 68 组实验证实,并分析了机械谐振原因。
  • 该发现已被交叉验证,成为 NavigationBench 评测中的经典案例。

04为什么偏偏是 arXivLabs?

arXivLabs 本身是学术共享平台,其核心基因就是开放、可验证、永不漂移的科研价值。AI Scientist 正是这一价值观的工程化实现。

从架构逻辑看,它把科研流程拆成可执行的闭环:

假设生成实验设计数据验证可证伪输出

每一步都强制附带「否定条件」——如果实验不能证明假设错误,则视为无效。这种结构化的科研品味,是传统 AI 系统从未达到的。

换句话说,它把「不漂移」写进了系统底层,而不是靠人工兜底。

编辑核心判断

AI 研究的下半场,比拼的不是生成多少结论,而是能否在长周期内让每个结论都站得住脚——arXivLabs 证明了这条路走通了。

现在就能用

arXivLabs 已开放 AI Scientist 测试接口,研究者可提交自定义四足导航任务,体验零漂移研究循环。

labs.arxiv.org/ai-scientist → 提交任务