OpenAI Astra:单题 200 美元,攻克十道数学世纪难题
7 月,OpenAI 确认下一代模型 Astra 以约 2000 美元推理成本攻克十道数学与理论计算机科学前沿难题,全部通过 Lean 形式化验证,代码已开源。平均每题 200 美元——约等于一个初级软件工程师一周的工资。这不是无差别的碾压,而是一份"成功精选集":早期探索阶段,GPT-5.2 Pro 对 Erdős 问题的一次通过率仅 1%–2%。
注:此处成本为推理算力边际成本,不含模型训练、基础设施及人类选题与验证时间。
7 月,OpenAI 确认下一代模型 Astra 以约 2000 美元推理成本攻克十道数学与理论计算机科学前沿难题,全部通过 Lean 形式化验证,代码已开源。平均每题 200 美元——约等于一个初级软件工程师一周的工资。这不是无差别的碾压,而是一份"成功精选集":早期探索阶段,GPT-5.2 Pro 对 Erdős 问题的一次通过率仅 1%–2%。
注:此处成本为推理算力边际成本,不含模型训练、基础设施及人类选题与验证时间。
这不是排行榜上的排名变化,而是一组被形式化验证过的、此前无人解出的数学对象。
Astra 交出的是一份横跨五个方向的成绩单:
但这份成绩单需要一句诚实的注脚。
即便如此,这份成绩单仍然是一道分水岭:AI 已从"解已知答案的题",跨越为"产出人类也未知的原创证明"。
如果没有 Lean,以上所有突破都缺少一个关键环节——可验证性。
Lean 将数学证明写成可被计算机逐行检查的代码。与传统同行评议依赖主观判断不同,Lean 验证是二进制的:要么编译通过,要么报错。一个证明在 Lean 中编译成功,就不需要人类相信它——它本身就是对的。
注:"sorry" 是 Lean 中的未完成占位符,计数为零,意味着十项成果没有任何步骤遗漏或未证。左右两组数字可对照理解:Astra 的 0 与整个数学库的 27 万条定理。
这项能力正在从增值功能变成基础设施。芯片验证领域,Axiom Math 的 AxiomProver 在 Putnam 竞赛拿到满分 12/12,公司以超 16 亿美元估值完成 2 亿美元 A 轮;密码学与生物医药领域,形式化验证也已进入早期落地阶段。
理解这次跨越,需要回看八个月。
OpenAI 宣称解决十个 Erdős 问题,随后被澄清——GPT-5 做的不是原创证明,而是文献搜索,在已有论文中找到了未被数据库收录的解答。
Neel Somani 生成 Erdős 问题 #397 的原创证明,经 Aristotle 系统完成 Lean 验证,陶哲轩确认为此前文献中不存在的新论证。随后 #728、#729 相继被攻克。
内部推理模型借用代数数论中的 Golod-Shafarevich 定理,找到一族反例,推翻自 1946 年提出的平面单位距离猜想。Tim Gowers 称之为"AI 数学的里程碑"。
十个开放问题、覆盖五个方向,全数通过 Lean 验证并开源。平均每题 200 美元。
注:以上四节点均取自已公开报道的事件;从"文献检索"到"独立发现",AI 完成角色跃迁用时八个月。
十道题不是由一个模型一口气推出来的。
这一流程与人类数学研究团队的组织方式高度同构。Anthropic、OpenAI、微软、LangChain 的共识是:让多个 AI 自由讨论不是最优方案,一个管理者分配任务、多个执行者交付结果才是。
Astra 并非孤例。
自主解决 9 个 Erdős 开放问题,最早一题已困扰学界 56 年,单题成本最低仅 7.5 美元。
双智能体框架 Rethlas + Archon 推翻 Anderson 猜想,国内首次由 AI 自主解决数学开放问题,生成约 19000 行 Lean 代码。
5 天完成 8 维(E8)球堆积定理形式化,再用约一周完成 24 维(Leech 格),总计约 20 万行 Lean 代码;原人类团队估计剩余工作量需 6 个月。
Anthropic、字节跳动 Seed-Prover、月之暗面 Kimina-Prover、DeepSeek-Prover-V2 等系统,也在推进神经定理证明的自动化。
形式化推理赛道,已经形成全球性竞争格局。
2000 美元这个数字,是整个故事里最具冲击力的细节。
一个 Erdős 级开放问题,顶尖数学家数年甚至数十年,折算成本在百万美元量级以上。
单题 200 美元、数小时级推理,可规模化、可定价、可并行。
转折还在继续:
注:图中柱形按成本绝对值等比绘制($7.5 在 $1000 面前几乎不可见,这正是要点);三组数据均来自对应团队公开披露。
当解决一个前沿数学猜想的边际成本降到 200 美元以下,"只有天才数学家才能做前沿数学"这个隐含前提,开始松动。
成本下降最直接的连锁反应,发生在密码学。
科研预算结构也在重配:从实验密集型转向推理密集型。OpenAI 于 7 月 29 日推出 "ChatGPT 学术研究者计划",向十万名科学家免费提供前沿模型访问权限,2027 年前投入 2.5 亿美元。
表面上是公益,本质上是在下一代科研范式中抢占用户习惯。
当 AI 能以 200 美元一题的边际成本产出数学成果,数学家自身的存在价值,被重新推上台面。
"如果 AI 能想出这样的证明,数学家的好日子可能很快就要结束了。"——当晚,Tim Gowers 误以为 AI "证明"了单位距离猜想。
次日他得知 AI 是"推翻"而非"证明"了猜想,明确表示"如释重负"。
这一细节折射出数学界对 AI 的复杂心态:既为其潜力震撼,又为其边界感到宽慰。
6 月 2 日,国际数学联盟正式背书《莱顿人工智能与数学宣言》,已有超 3000 人签署。宣言列出 AI 对数学的五大威胁:不可靠结果、归属缺失、依赖不平等、过度炒作、自主性丧失。
还有一个绕不过去的递归困境:AI 每天能产生几十个候选解,人类同行评议根本消化不了这个流量。要规模化验证 AI 的产出,需要 AI 来自动化验证——但这又回到了"谁来验证验证 AI 的 AI"。
当 AI 产出速度是人类验证速度的百倍以上,最终裁决权可能退化为抽样检查权。
AI 解决的是"证明型突破";而"提出一个需要直觉跳跃的新猜想"——概念型突破——依然是人类最稀缺的能力。但单位距离问题的突破也展示了 AI 超出预期的跨域联想:它将代数数论的 Golod-Shafarevich 定理用于离散几何,被数学家 Arul Shankar 评价为"具备原创、精妙的独立思想"。
当一个数学猜想的边际解决成本降到 200 美元,它就不再是"科研",它变成了"查询"。
重新定义成本结构,往往意味着产业变革的开始——而这一次,崩塌发生在了"证明"这件人类智力的核心事务上。
什么值得发现、发现之后如何理解、谁来为发现负责——这三问,仍然只属于人类。
OpenAI "ChatGPT 学术研究者计划"已开放:十万名科学家免费使用前沿模型,2027 年前投入 2.5 亿美元。
当一道道数学难题变成 200 美元一次的"查询",第一批用上新范式的,会是你吗?