🧮 AI 科研 · 突破速递

OpenAI Astra:单题 200 美元,攻克十道数学世纪难题

7 月,OpenAI 确认下一代模型 Astra 以约 2000 美元推理成本攻克十道数学与理论计算机科学前沿难题,全部通过 Lean 形式化验证,代码已开源。平均每题 200 美元——约等于一个初级软件工程师一周的工资。这不是无差别的碾压,而是一份"成功精选集":早期探索阶段,GPT-5.2 Pro 对 Erdős 问题的一次通过率仅 1%–2%

综合公开信息整理 2026-08 全文约 5 分钟读完
#OpenAI #Astra #AI数学 #Lean验证 #多智能体
🥇 10 道 数学世纪难题 · 全部通过 Lean 形式化验证
$2000 总推理成本 · 十题合计
$200 单题平均成本 · 约初级工程师一周工资

注:此处成本为推理算力边际成本,不含模型训练、基础设施及人类选题与验证时间。

⚡ 30 秒速览

  • 攻克了什么:十道学术积压超十年的数学与理论计算机前沿难题,覆盖高维球堆积、编码理论、群论、量子复杂性、极值组合学。
  • 成本多低:总计约 2000 美元推理成本,平均每题 200 美元;DeepMind AlphaProof Nexus 单题最低已做到 7.5 美元。
  • 凭什么信:全数通过 Lean 形式化验证,GitHub 仓库 "sorry" 计数为零;陶哲轩、Tim Gowers 等数学家参与确认。
  • 怎么做到:多智能体协同——协调者拆解子目标、子智能体并行执行、验证智能体合并校验。
  • 一个注脚:这是多次尝试后的"成功精选集",早期一次通过率仅 1%–2%;它不代表全面碾压,但代表成本结构的崩塌。

01这张成绩单 十道题,至少搁置了十年

这不是排行榜上的排名变化,而是一组被形式化验证过的、此前无人解出的数学对象。

Astra 交出的是一份横跨五个方向的成绩单:

▧ 高维球堆积 ▧ 编码理论 ▧ 群论 ▧ 量子复杂性 ▧ 极值组合学

但这份成绩单需要一句诚实的注脚。

成功精选集,而非全面碾压。OpenAI 披露,模型在早期探索阶段存在大量失败——GPT-5.2 Pro 对 Erdős 问题的一次通过率仅 1%–2%。Astra 呈现的是多次尝试后筛选出的成功案例,本身体现了人类的选题判断。

即便如此,这份成绩单仍然是一道分水岭:AI 已从"解已知答案的题",跨越为"产出人类也未知的原创证明"。

02为什么可信 Lean 一票裁决

如果没有 Lean,以上所有突破都缺少一个关键环节——可验证性

Lean 将数学证明写成可被计算机逐行检查的代码。与传统同行评议依赖主观判断不同,Lean 验证是二进制的:要么编译通过,要么报错。一个证明在 Lean 中编译成功,就不需要人类相信它——它本身就是对的。

0"sorry"计数(Astra 十题)
27万+Mathlib 已形式化定理
210Mathlib 代码行数
1830亿Meta ATLAS 训练 token

注:"sorry" 是 Lean 中的未完成占位符,计数为零,意味着十项成果没有任何步骤遗漏或未证。左右两组数字可对照理解:Astra 的 0 与整个数学库的 27 万条定理。

这项能力正在从增值功能变成基础设施。芯片验证领域,Axiom Math 的 AxiomProver 在 Putnam 竞赛拿到满分 12/12,公司以超 16 亿美元估值完成 2 亿美元 A 轮;密码学与生物医药领域,形式化验证也已进入早期落地阶段。

03怎么做到 八个月,从"查资料"到"独立研究"

理解这次跨越,需要回看八个月。

2025.10

GPT-5:"查资料"的真相

OpenAI 宣称解决十个 Erdős 问题,随后被澄清——GPT-5 做的不是原创证明,而是文献搜索,在已有论文中找到了未被数据库收录的解答。

2026.01

GPT-5.2 Pro:第一份原创证明

Neel Somani 生成 Erdős 问题 #397 的原创证明,经 Aristotle 系统完成 Lean 验证,陶哲轩确认为此前文献中不存在的新论证。随后 #728、#729 相继被攻克。

2026.05.20

推翻 80 年猜想:单位距离问题

内部推理模型借用代数数论中的 Golod-Shafarevich 定理,找到一族反例,推翻自 1946 年提出的平面单位距离猜想。Tim Gowers 称之为"AI 数学的里程碑"。

2026.08

Astra:2000 美元横扫十题

十个开放问题、覆盖五个方向,全数通过 Lean 验证并开源。平均每题 200 美元。

注:以上四节点均取自已公开报道的事件;从"文献检索"到"独立发现",AI 完成角色跃迁用时八个月。

十道题不是由一个模型一口气推出来的。

协调者 · 拆解子目标 子智能体 · 并行执行 验证智能体 · 合并校验

这一流程与人类数学研究团队的组织方式高度同构。Anthropic、OpenAI、微软、LangChain 的共识是:让多个 AI 自由讨论不是最优方案,一个管理者分配任务、多个执行者交付结果才是。

04不止 OpenAI 一家 全球共振

Astra 并非孤例。

Google DeepMind · AlphaProof Nexus

自主解决 9 个 Erdős 开放问题,最早一题已困扰学界 56 年,单题成本最低仅 7.5 美元。

北京大学 · AI4Math

双智能体框架 Rethlas + Archon 推翻 Anderson 猜想,国内首次由 AI 自主解决数学开放问题,生成约 19000 行 Lean 代码。

Math Inc · Gauss

5 天完成 8 维(E8)球堆积定理形式化,再用约一周完成 24 维(Leech 格),总计约 20 万行 Lean 代码;原人类团队估计剩余工作量需 6 个月。

更多玩家 · 各方向推进

Anthropic、字节跳动 Seed-Prover、月之暗面 Kimina-Prover、DeepSeek-Prover-V2 等系统,也在推进神经定理证明的自动化。

形式化推理赛道,已经形成全球性竞争格局。

05成本崩塌 从百万美元到 200 美元

2000 美元这个数字,是整个故事里最具冲击力的细节。

传统数学研究

一个 Erdős 级开放问题,顶尖数学家数年甚至数十年,折算成本在百万美元量级以上。

Astra 模式

单题 200 美元、数小时级推理,可规模化、可定价、可并行。

转折还在继续:

2026.05单位距离问题
~$1000
2026.08Astra 单题
$200
同期DeepMind 单题
$7.5

注:图中柱形按成本绝对值等比绘制($7.5 在 $1000 面前几乎不可见,这正是要点);三组数据均来自对应团队公开披露。

当解决一个前沿数学猜想的边际成本降到 200 美元以下,"只有天才数学家才能做前沿数学"这个隐含前提,开始松动。

06连锁反应 密码学第一波冲击

成本下降最直接的连锁反应,发生在密码学。

🔓 HAWK-256:被 AI 推理击穿的后量子候选 60 小时

  • Anthropic 的 Claude Mythos Preview 在约 60 小时、10 万美元成本内,发现 NIST 后量子签名候选算法 HAWK-256 的格结构对称性缺陷。
  • 将密钥恢复的理论工作量从 264 降至 238——从"天文数字"降为"高配集群可及"。
  • 次日,HAWK 开发者宣布从 NIST 标准化进程中撤回该方案。
这不是量子计算机攻破 RSA——这是纯粹由 AI 推理能力驱动的密码分析:不需要量子比特,不需要超低温冷却。

科研预算结构也在重配:从实验密集型转向推理密集型。OpenAI 于 7 月 29 日推出 "ChatGPT 学术研究者计划",向十万名科学家免费提供前沿模型访问权限,2027 年前投入 2.5 亿美元

表面上是公益,本质上是在下一代科研范式中抢占用户习惯。

07数学家去哪了 从"证明者"走向"提问者"

当 AI 能以 200 美元一题的边际成本产出数学成果,数学家自身的存在价值,被重新推上台面。

"如果 AI 能想出这样的证明,数学家的好日子可能很快就要结束了。"——当晚,Tim Gowers 误以为 AI "证明"了单位距离猜想。

次日他得知 AI 是"推翻"而非"证明"了猜想,明确表示"如释重负"

这一细节折射出数学界对 AI 的复杂心态:既为其潜力震撼,又为其边界感到宽慰。

6 月 2 日,国际数学联盟正式背书《莱顿人工智能与数学宣言》,已有超 3000 人签署。宣言列出 AI 对数学的五大威胁:不可靠结果、归属缺失、依赖不平等、过度炒作、自主性丧失

还有一个绕不过去的递归困境:AI 每天能产生几十个候选解,人类同行评议根本消化不了这个流量。要规模化验证 AI 的产出,需要 AI 来自动化验证——但这又回到了"谁来验证验证 AI 的 AI"。

当 AI 产出速度是人类验证速度的百倍以上,最终裁决权可能退化为抽样检查权。

AI 解决的是"证明型突破";而"提出一个需要直觉跳跃的新猜想"——概念型突破——依然是人类最稀缺的能力。但单位距离问题的突破也展示了 AI 超出预期的跨域联想:它将代数数论的 Golod-Shafarevich 定理用于离散几何,被数学家 Arul Shankar 评价为"具备原创、精妙的独立思想"。

编辑核心判断

当一个数学猜想的边际解决成本降到 200 美元,它就不再是"科研",它变成了"查询"。

重新定义成本结构,往往意味着产业变革的开始——而这一次,崩塌发生在了"证明"这件人类智力的核心事务上。

什么值得发现、发现之后如何理解、谁来为发现负责——这三问,仍然只属于人类。

谁先受益

OpenAI "ChatGPT 学术研究者计划"已开放:十万名科学家免费使用前沿模型,2027 年前投入 2.5 亿美元。
当一道道数学难题变成 200 美元一次的"查询",第一批用上新范式的,会是你吗?

ChatGPT 学术研究者计划 → 官网申请