🧮 数学 · AI 前沿

LLM 框架首次实现重大数学猜想自主发现:AI 距离 Riemann Hypothesis 还有多远?

来自 arXiv 的最新研究提出了 ConjectureAgent——一个将 LLM 的数学直觉与形式化验证工具深度融合的框架,在数论、组合学等五个分支中自主生成 87 个新猜想,其中 28 个被领域专家评为"有趣"或"有价值",12 个已通过形式化验证。

来源:公开报道 2026-07-22 全文约 3 分钟读完
#数学猜想 #LLM 框架 #ConjectureAgent #AI 数学发现 #Riemann Hypothesis
87 个 自主生成新猜想 · 覆盖 5 个数学分支
28 被专家评为"有趣"或"有价值"
12 已通过形式化验证,确认为真
⭐ 30 秒速览
  • 做了什么:提出 ConjectureAgent 框架,让 LLM 不只能回答问题,还能自主生成数学猜想并验证。
  • 成绩如何:在数论、组合学、图论、代数、分析 5 个分支生成 87 个猜想,28 个获专家认可,12 个被形式化工具确认。
  • 为什么可信:每个猜想都经过 Lean 4 形式化验证 + 独立专家双盲评审,结果可复现。
  • 深层信号:AI 在数学发现中的角色正在从"计算工具"转向"合作者"——框架设计思路可迁移至其他科学领域。

01ConjectureAgent:不是算题,是发现

传统数学 AI 评测考的是"解题能力"——给定问题,输出答案。但 ConjectureAgent 的定位完全不同:它要 在没有明确问题的情况下,主动发现数学中尚未被注意的模式,并将其表述为可验证的猜想。

换个说法:

传统数学 AI

考"模型知不知道答案"——在已知问题集上做测试,与现实数学研究距离较远。

ConjectureAgent

考"模型能不能发现数学中尚未被注意的模式,并交付可验证的猜想"。

5数学分支
87生成猜想
28专家认可
12形式化确认

注:5 个分支为数论、组合学、图论、代数、分析。每个猜想均经过 Lean 4 形式化验证与至少 2 位专家独立评审,双盲打分。

核心差异在于 「发现」而非「解答」。ConjectureAgent 不依赖已有题库,而是通过在大规模数学结构中进行模式搜索 → 假设生成 → 形式化验证的闭环,自主产出新知识。

02它到底发现了什么?三个满分案例

🔢 数论:素数分布的新模式 专家评分 4.8/5

  • 10⁶ 以内的素数区间中,发现了一种与 Chebyshev 偏斜相关的局部密度模式,此前未被文献记录。
  • Agent 自主生成假设,用 Lean 4 验证了其在特定区间内的正确性,并将结论推广为一般形式。
  • 评审专家评价:「这个模式虽然不深,但非常精巧——以前没有人从这个角度观察过。」
验证维度:猜想表述 / 形式化证明 / 推广合理性 / 新颖性 —— 综合评分 4.8/5。

📐 组合学:图论中的新不等式 满分 5.0

  • 发现了一个关于 图的色数 χ(G) 与团数 ω(G) 之间的新不等式,在特定图类中比已知的 Mycielski 界更紧。
  • Agent 自主构建了 37 个反例来测试边界,最终将不等式限定在 K₅-free 图类中,确保结论的精确性。
  • 专家评审结论:「这是一个有潜力的结果,值得进一步研究。」
所有维度满分。评审特别指出:Agent 主动构建反例的能力令人印象深刻。

🧮 代数:特殊函数恒等式 验证通过

  • Ramanujan 型 q-级数领域,发现了一个新的恒等式,将三个已知恒等式统一为更一般的形式。
  • Agent 使用 符号计算 + 形式化推理双路径验证,确保等号两侧在定义域内完全等价。
  • 该恒等式已通过 Lean 4 的完整形式化检验,可作为引理直接用于后续研究。
验证通过,已被收录至开源数学知识库。

03为什么是现在做出来了?

答案不复杂:LLM 的数学直觉 + 形式化验证的严谨,过去从未被如此系统地结合在一起。 ConjectureAgent 的核心架构是一个三阶段闭环:

模式搜索假设生成形式化验证

第一阶段,LLM 在大规模数学数据(定理、证明、结构)中识别潜在模式;第二阶段,将这些模式表述为形式化的猜想;第三阶段,用 Lean 4 验证其正确性,并反馈给模型进行迭代。

一个诚实的注脚:

目前发现的猜想大多属于 "精巧但不够深刻" 的范畴——没有触及 Riemann Hypothesis 或 Birch-Swinnerton-Dyer 猜想这个级别的核心问题。但框架的底层逻辑是通用的:只要搜索空间足够大、验证工具足够快,更深层的发现只是时间问题。

研究者特别强调,ConjectureAgent 的定位是 「数学家的合作者,而非替代者」——它负责生成候选猜想,由人类专家来判断哪些值得深入探索。这种"AI 提议 → 人类裁决"的模式,可能正是数学发现未来的工作流。

编辑核心判断

ConjectureAgent 带来的不是"AI 独立攻克重大猜想"的戏剧性突破,而是一个更务实的信号:数学发现的模式正在从"天才的灵光一现"转向"AI 提议 + 人类判断"的协作范式。框架本身比它当前产出的任何一个猜想都更重要。

探索与参与

框架已开源,完整评测流程、生成的猜想列表、形式化验证代码以及专家评审记录全部公开。

GitHub → ConjectureAgent