LLM 框架首次实现重大数学猜想自主发现:AI 距离 Riemann Hypothesis 还有多远?
来自 arXiv 的最新研究提出了 ConjectureAgent——一个将 LLM 的数学直觉与形式化验证工具深度融合的框架,在数论、组合学等五个分支中自主生成 87 个新猜想,其中 28 个被领域专家评为"有趣"或"有价值",12 个已通过形式化验证。
来自 arXiv 的最新研究提出了 ConjectureAgent——一个将 LLM 的数学直觉与形式化验证工具深度融合的框架,在数论、组合学等五个分支中自主生成 87 个新猜想,其中 28 个被领域专家评为"有趣"或"有价值",12 个已通过形式化验证。
传统数学 AI 评测考的是"解题能力"——给定问题,输出答案。但 ConjectureAgent 的定位完全不同:它要 在没有明确问题的情况下,主动发现数学中尚未被注意的模式,并将其表述为可验证的猜想。
换个说法:
考"模型知不知道答案"——在已知问题集上做测试,与现实数学研究距离较远。
考"模型能不能发现数学中尚未被注意的模式,并交付可验证的猜想"。
注:5 个分支为数论、组合学、图论、代数、分析。每个猜想均经过 Lean 4 形式化验证与至少 2 位专家独立评审,双盲打分。
核心差异在于 「发现」而非「解答」。ConjectureAgent 不依赖已有题库,而是通过在大规模数学结构中进行模式搜索 → 假设生成 → 形式化验证的闭环,自主产出新知识。
答案不复杂:LLM 的数学直觉 + 形式化验证的严谨,过去从未被如此系统地结合在一起。 ConjectureAgent 的核心架构是一个三阶段闭环:
第一阶段,LLM 在大规模数学数据(定理、证明、结构)中识别潜在模式;第二阶段,将这些模式表述为形式化的猜想;第三阶段,用 Lean 4 验证其正确性,并反馈给模型进行迭代。
一个诚实的注脚:
目前发现的猜想大多属于 "精巧但不够深刻" 的范畴——没有触及 Riemann Hypothesis 或 Birch-Swinnerton-Dyer 猜想这个级别的核心问题。但框架的底层逻辑是通用的:只要搜索空间足够大、验证工具足够快,更深层的发现只是时间问题。
研究者特别强调,ConjectureAgent 的定位是 「数学家的合作者,而非替代者」——它负责生成候选猜想,由人类专家来判断哪些值得深入探索。这种"AI 提议 → 人类裁决"的模式,可能正是数学发现未来的工作流。
ConjectureAgent 带来的不是"AI 独立攻克重大猜想"的戏剧性突破,而是一个更务实的信号:数学发现的模式正在从"天才的灵光一现"转向"AI 提议 + 人类判断"的协作范式。框架本身比它当前产出的任何一个猜想都更重要。
框架已开源,完整评测流程、生成的猜想列表、形式化验证代码以及专家评审记录全部公开。
GitHub → ConjectureAgent