大模型数学能力两年跨越:从中考线到奥数满分,学界聚焦可解释性瓶颈
7 月 24 日,在云南玉溪举办的十六省数学学术年会上,北电数智首席科学家窦德景披露了一组关键对比数据:2024 年十余个主流大模型高考数学均未达一本线,2026 年已普遍突破 135 分,并在无提前获知题目的情况下取得奥数满分。但中科院院士周向宇在同场对话中指出,AI 数学的可解释性黑箱仍是未解难题。
7 月 24 日,在云南玉溪举办的十六省数学学术年会上,北电数智首席科学家窦德景披露了一组关键对比数据:2024 年十余个主流大模型高考数学均未达一本线,2026 年已普遍突破 135 分,并在无提前获知题目的情况下取得奥数满分。但中科院院士周向宇在同场对话中指出,AI 数学的可解释性黑箱仍是未解难题。
窦德景在论坛上分享了一组反映大模型数学推理能力演进的对比数据。2024 年,十余个主流大模型在高考数学中均未能达到一本线;而到 2026 年,这些模型已普遍能考取重点大学,数学单科最低分 135 分,最高分突破 140 分。
十余个模型高考数学均未达一本线,面对复杂变量耦合的推演极易出错。
普遍突破 135 分,无提前获知题目情况下取得奥数满分,达到人类顶尖智力群体水平。
这意味着,大模型在可程序化、符号运算、离散构造等数学分支中,依托海量学术文献与定理数据完成的深度表征学习,已能高效完成人类因计算规模庞大而无意推进的命题验证与实例构造工作。
在与窦德景的对话中,中科院院士周向宇从数学家视角给出了明确判断:AI 的核心优势主要在模式检索与机械推演,而非真正意义上的数学创新。
双方聚焦数学难题雅可比猜想展开讨论。周向宇指出,主流专家对三维及以上情形普遍认为存在反例,但二维情形的真伪仍是未解难题。AI 几乎不受人力局限,只要算力充沛便能不间断开展大规模启发式搜索与高强度数值、符号运算。
「AI 可以硬生生给出反例,人类验算确实无误,但无法得知答案从何而来。」
—— 中科院院士 周向宇窦德景进一步追问:如果 AI 只给答案却无法解释推理路径,是否算「真正理解」?这一「黑箱问题」既是数学家的困惑,也恰恰是未来研究的发力点。人工智能究竟在多大程度内化并理解了数学概念与内在逻辑,抑或只是在高维数据空间中通过统计拟合匹配出有效的数学关联?这一核心疑问至今缺乏定论。
周向宇给出了明确判断:数学家从古至今都在创造计算工具,核心使命始终是让机器辅助人类。机器能做的事,数学家不必重复去做;数学家要做的是机器不能做的事——不存在被取代的风险。
人类数学家擅长从纷繁复杂的现象中提炼简洁的数学结构,通过直觉、联想与抽象思维建立新的理论框架。AI 的定位是「助手」,承担大规模验证、重复计算、文献检索等基础工作。真正推动数学前进的,从来不是孤立的答案,而是答案背后的思想与方法。
不过,周向宇也指出了 AI 辅助研究中的学术规范挑战:传统论文引用须严格标明思想来源,但当前 AI 生成结果无法清晰追溯参考了哪些已有工作,直接冲击了学术界的引用伦理与成果归属体系。
窦德景在论坛上系统阐述了北电数智的产业落地路径。在算力层面,公司正以全国 30 余个城市为支点推进算力中心建设,整合万卡级算力资源,支撑万亿参数级大模型训练。在此基础上构建「数算模用」全栈闭环体系——数据、算力、模型、应用四者咬合。
依赖人工经验判断,皮肤专病诊断耗时长,中级医师考核准确率受个体经验波动影响。
皮肤专病大模型经专病数据训练,考核准确率达 90%,诊疗时间缩短 20%。
在先进制造业领域,北电数智的星火大模型已投入实际应用;在国产算力方面,公司正推动国产芯片从「可用」走向「好用」。窦德景引用菲尔兹奖得主埃菲·杰曼诺夫的观点指出,AI 与数学的关系不是简单叠加,而是「乘」的关系——深度拆解、同频共振,方能推动范式跃迁。
本文原始素材由北电数智提供并授权转载,本质属于企业通稿。文中「主流大模型奥数满分」「高考 140 分+」等关键数据为单方披露,未见第三方独立复测验证,读者宜将其视为行业趋势的定性参考,而非精确 benchmark。同时,论坛由十六省数学会联合主办、中科院院士参与对话,学术背书层面具有可信度,但产业落地部分(如 90% 准确率、20% 提速)仍属企业自报。
北电数智星火大模型及「数算模用」全栈体系已在医疗、工业制造领域落地,更多产品动态可关注其官方发布渠道。
北电数智官网 → 了解星火大平台