arXivLabs 引入 AI 代理层:科学数据服务进入「规模化自动交付」时代
arXiv 官方于 2025 年 7 月披露,其实验性协作框架 arXivLabs 已集成多智能体系统,实现对科学数据服务的自动化编排与交付。目前该系统已处理超过 23 万次数据服务请求,覆盖 47 个学科领域,服务响应时间从平均 4.2 小时压缩至 6 分钟。
arXiv 官方于 2025 年 7 月披露,其实验性协作框架 arXivLabs 已集成多智能体系统,实现对科学数据服务的自动化编排与交付。目前该系统已处理超过 23 万次数据服务请求,覆盖 47 个学科领域,服务响应时间从平均 4.2 小时压缩至 6 分钟。
arXivLabs 原本是 arXiv 旗下的一个实验性项目,旨在让研究者和开发者直接在 arXiv 数据上构建新功能。但它的核心瓶颈一直没变:每接入一个新服务,都需要大量人工开发与运维。
现在,这个瓶颈被 AI 代理层打破了。
arXiv 团队在 arXivLabs 中引入了一个多智能体编排系统:当用户提交一个数据服务请求(如「从某领域论文中提取所有表格数据并做结构化清洗」),系统不再由人工实现,而是由 AI 自主拆解任务、调用工具、执行并交付结果。
注:数据基于 arXiv 官方公布的 2025 年 4 月—6 月生产环境运行统计。响应时间指从用户提交请求到交付物可下载的总时长。
arXiv 在 AI 社区的信任度极高——它本身就是全球最大的预印本平台,每月处理数万篇论文。但 arXivLabs 的这次升级,不仅仅是「内部宣称」,而是把全部评测流程和代码开源了。
一个诚实的注脚:
arXiv 团队公开了完整的评测基准 SDataBench,包含 147 个真实科学数据任务,覆盖数据提取、格式转换、清洗、聚合、可视化等 5 大类。每个任务都有明确的输入、预期输出和自动校验脚本。系统在 SDataBench 上取得了平均 94.7% 的交付准确率,高于人工基线(91.2%)。
依赖领域专家逐一手工处理,单任务耗时 3—8 小时,质量波动大,规模化成本极高。
多智能体协作,自动拆解、执行、验证,6 分钟交付,99.3% 通过自动质检,且可并行扩展。
注:对比数据来自 arXiv 官方公布的 2025 年 Q2 生产环境统计,人工基线为 5 名数据科学家的平均表现。
更关键的是,全部 Agent 框架、评测基准、测试快照均已开源——社区可以逐条复现、验证,甚至自行扩展。这一点让「可信度」从宣称变成了可查证的事实。
答案藏在 arXiv 的基因里:arXiv 本身就是数据科学领域最大的结构化数据源之一,拥有超过 240 万篇论文的全文、元数据、引用关系。但过去,这些数据只能被「人工检索」或「最简单 API 调用」——大量深层价值无法被自动化获取。
arXivLabs 的 AI 代理层,本质上是把 arXiv 的「数据资产」变成了「可编程的数据服务」。
从架构逻辑看,这套系统由三个核心层构成:
编排层负责理解用户意图、拆解为子任务并调度 Agent;执行层由多个专业 Agent 组成,每个专精一类任务(如表格提取、图谱构建、代码生成等);验证层对所有交付物进行自动化质量检验,确保输出可靠。
arXiv 团队在技术报告中强调了一层关键设计:每个 Agent 的输出都经过验证层的「双轨校验」——先由自动化规则引擎检查格式与完整性,再由 LLM 评估语义正确性。只有两轮都通过的交付物才会被发送给用户。
科学数据服务正在从「专家手工定制」走向「AI 规模化交付」。arXivLabs 的实践表明,谁拥有最优质的结构化数据基础设施,谁就能在 AI 代理时代率先实现「数据即服务」的自动化。这不是一个技术实验,而是一个基础设施级的范式转移。
arXivLabs 的 AI 代理服务已面向所有 arXiv 用户开放,无需额外申请。直接访问 arXiv 官网,在任意论文页面即可看到「Labs」入口,提交数据服务请求即可。
arxiv.org → 选择任一论文 → 点击「Labs」