AI 开源模型数量突破百万,arXivLabs 推动社区透明化协作
arXiv 官方宣布,其上托管与 AI 相关的开源模型、代码及预印本总量已突破100 万件。支撑这一规模的关键基础设施——arXivLabs 框架,正以开放式协作、透明化评审、社区驱动的模式,重新定义 AI 研究的共享与可复现标准。
arXiv 官方宣布,其上托管与 AI 相关的开源模型、代码及预印本总量已突破100 万件。支撑这一规模的关键基础设施——arXivLabs 框架,正以开放式协作、透明化评审、社区驱动的模式,重新定义 AI 研究的共享与可复现标准。
当 AI 模型从一个研究实验室的封闭项目,变成全球数十万开发者手中的工具,一个关键问题随之浮现:这些模型与代码,到底有多少是真正可复现、可验证的?
arXiv 给出的答案是:100 万件,并且还在加速增长。
截至 2026 年 7 月,arXiv 上托管的所有 AI 相关开源模型、代码仓库、预印本及可复现实验包的总量已突破 100 万件。其中,2025 年全年新增 15 万件,而 2026 年上半年已完成 8.5 万件——增速仍在攀升。
标签云展示了 arXivLabs 生态中主要的提交类型分布。深色标签为占比最高的类别。
百万级规模背后,是 arXivLabs 这套框架在支撑。它与传统学术共享平台的区别非常直接:
封闭审稿,评审过程不可见;提交物与代码分离,复现成本高。
所有评审过程公开、社区可追踪;提交物与代码、数据、复现包绑定,一键可复现。
三项核心原则:开放性、社区性、卓越性。arXiv 承诺只与完全对齐这些原则的合作伙伴协作。
更关键的是,arXivLabs 并不要求所有提交者——无论个人还是机构——都立刻达到完美标准。框架提供渐进式协作机制:
这条路意味着:一个 AI 模型从诞生到可复现之间,不再需要跨越封闭审稿的鸿沟。社区驱动的评审机制,正在替代传统学术出版中的"黑箱"。
流程图展示了 arXivLabs 框架下,从提交想法到正式发布的全流程。每个环节的评审记录对社区公开。
一个诚实的注脚:
arXivLabs 并非完美。它的社区驱动模式意味着评审速度较慢、部分提交需要反复迭代,对于追求"快速发表"的研究者来说,这不是最优选择。
但它的价值,恰恰在于慢。
当传统审稿系统可以被"定向邀请"或"关系评审"绕过时,arXivLabs 的公开评审提供了另一种可能性:不是越快越好,而是越透明越好。
评分徽章展示了 arXivLabs 框架的核心功能标签。每一项都直接对应经典"可复现性危机"的解决方案。
对于 AI 研究的未来,arXivLabs 投下了一个关键变量:当社区透明协作成为标准,那些"看上去很漂亮但跑不出来"的论文,将无处遁形。
答案不复杂:arXiv 在预印本共享这件事上,已经跑了 30 多年。它本身就是开放科学的前身。
从 1991 年物理预印本起步,到 2020 年代 AI 研究的爆发式增长,arXiv 始终在做同一件事:把知识的围墙推倒。
变化的只是形态:从 PDF 上传变成了代码+数据+模型+复现包的完整提交;从被动存档变成了主动协作、社区驱动的平台。底层逻辑一脉相承。
搞清楚了一件事:开放不是姿态,而是工程。
arXivLabs 证明,当平台从架构层面内置透明评审与数据卡标准,开源生态的质量会自然提升——而不是依赖事后审核或道德呼吁。
AI 开源生态的下一个瓶颈不是模型能力,而是可复现性基础设施。arXivLabs 代表的方向——平台级透明协作——将成为未来 3 年 AI 研究可信度的分水岭。
arXivLabs 框架已全面开放,任何个人或机构均可提交项目、参与评审。访问 arXiv 官网,通过 "arXivLabs" 入口提交你的想法。
arxiv.org/labs → 提交项目