看模型发布会的数学成绩单,你会以为 AI 明年就能拿菲尔兹奖;看数学家的联名声明,你会以为 AI 的数学还停留在背题。两边都不是谣言——差别在于用什么尺子去量。数学评测是 AI 进步最快的单一维度,也是争议最集中的单一维度:基准在五年里被卷死了四代,数据污染从怀疑变成有实锤的机制,评测机构和实验室之间的资助关系被起底,数学社区则在 2026 年集体发声。本文把这五年的尺子摆在一起,看看「AI 会做数学」这句话到底在哪个意义上成立。
五年,基准难度涨了四个数量级
数学基准的迭代速度,本身就是大模型能力的最直观记录:
| 基准 | 发布 | 题目规模与类型 | 现状(截至 2026-10) |
|---|---|---|---|
| GSM8K | 2021 | 8500 道小学应用题 | 已饱和,失去区分度 |
| MATH | 2021 | 12500 道竞赛题,发布时最好模型 6.9% | 头部模型普遍超九成,视为饱和 |
| AIME | 2025 起考后即测 | 每年 30 道竞赛题 | 头部模型无工具已到 95% 以上 |
| OMNI-MATH | 2024 | 4428 道奥赛级题 | 发布时最好模型刚过六成 |
| HLE 数学部分 | 2025 | 佔全卷 41%,为最大类别 | 发布时最好约 9–10%,现已破六成 |
| FrontierMath | 2024 | 独创未公开研究级题 | 不到 2% 涨到约 52%(v1 冻结口径) |
| IMO-ProofBench | 2025 | 证明题,含 IMO 难度档 | 最高分从 65.7% 升至约九成 |
| MathArena | 2025 | 刚考完的竞赛题,防污染 | 短答案题饱和,已官宣转型 |
这条演进线的读法比数字本身重要。GSM8K 到 MATH 是「小学到竞赛」;MATH 到 AIME、OMNI-MATH 是「竞赛到奥赛」;FrontierMath 直接跳到「数学家训练有素也要做几小时到几天的研究级题目」;2026 年的 FrontierMath Erdős 版干脆收录 68 道数学界至今未解的 Erdős 问题。每换一代基准,旧一代就被头部模型在一年左右卷到饱和——评测的「保质期」从十年缩到一年。
FrontierMath:野心、乌龙与资助风波
FrontierMath 值得单独一章,因为它把「研究级评测」的雄心、执行层的乌龙和利益结构的争议全演了一遍。
先说设计。它由 Epoch AI 在 2024 年 11 月发布,题目由 60 多位数学家原创且不公开,分四档难度:第一档约 IMO 或高年级本科水平,第四档是「短期研究项目」级别;首发版本收录 350 题——前三档共 300 题、第四档 50 题,2026 年 6 月修订后的 v2 为 338 题。模型可以用 Python 工具,单题最多消耗一百万 token。出题人名单里有 Ken Ono 这样的名家——他的态度很直白:希望 AI 得零分。陶哲轩、Gowers、Borcherds 试题后评价第三档「exceptionally challenging」。人类基线是 MIT 比赛形式的对照实验:顶尖选手 4.5 小时做 23 题,队均解出 19%,八队合力解出 35%——这是理解一切机器分数的参照系。
再说乌龙。2024 年 12 月 OpenAI 宣布 o3 拿下 25%,震惊业界;2025 年 4 月 Epoch 独立复测发现,标准算力配置下成绩远低于宣称值,只有在高算力配置下才接近 25%——「同一模型同一基准」的分数差了一倍多,口径之争(算力预算、工具配置、单轮还是智能体式作答)从此成为评测报道的必修课。
最重的是资助风波。2024 年 12 月 20 日,Epoch 在 o3 发布同日更新论文,披露 FrontierMath 由 OpenAI 全额资助、且 OpenAI 独享大部分题目与解答,双方只有口头协议约定不用于训练;出题数学家事先不知道金主是谁。批评在 2025 年 1 月集中爆发,Epoch 总监承认应该更早披露。1 月 23 日 Epoch 发布澄清与整改:留出 50 题 OpenAI 接触不到解答,供独立测试;此后公开赞助关系。事件没有否定题目质量,但它示范了「私有题库 + 单一实验室资助 + 不可独立复核」这套组合的结构性风险。2026 年 6 月的 v2 版本又修正或移除了约四成题目——质量控制的长期欠账,最终还是还了。
数据污染:分数泡沫的第一来源
「高分是背题」流传了很多年,2024 年起有了定量实锤。
最干净的证据来自 GSM1k(Scale AI,NeurIPS 2024):研究者按人类解出率、步数、答案量级等指标,仿造 GSM8K 出了 1000 道同风格新题。结果是一张「过拟合光谱」:掉点最多的小模型达 8 个百分点,Mistral 和 Phi 系列是重灾区;机制证据更漂亮——模型对 GSM8K 原题文本的对数似然与掉点幅度呈显著相关(Spearman 0.36),越像背过原题的模型,换新题后掉得越狠。边界也要说清:GPT、Claude、Gemini 等前沿模型掉点很小,污染是「部分模型家族的系统性过拟合」,不是全行业通病。
另一条线是 Apple 的 GSM-Symbolic(2024 年 10 月):用符号模板生成 GSM8K 的同构变体,再加一句「看起来相关但实际无关」的干扰从句,各代头部模型最多掉 65 个百分点——这一半是污染,一半是脆弱性:模型不是在推理,是在匹配见过的模式。而 MathArena 平台在论文里直接写明 AIME 2024 检出强污染迹象,因此只测训练截止日之后考完的竞赛。「考后即测」由此成为防污染的行业范式。
污染的镜像是「会算答案不等于会写证明」:MathArena 团队对 USAMO 2025 的证明题评测(论文题为「Proof or Bluff」)里,当时最强的 Gemini 2.5 Pro 按官方评分标准只拿到 42 分中的 10.1 分——同一个模型,答案题接近满分,证明题刚过四分之一。
2026:评测转向证明、Lean 与真正的未解之谜
答案题的饱和逼出了评测范式的整体转向,三条线在 2026 年汇合。
第一是证明题基准。DeepMind 的 IMO-ProofBench(2025 年 10 月起)让模型写完整证明而非只报答案,分三档难度,最高档含约 30 道 IMO 级别题;Gemini Deep Think 的最高档成绩从 2025 年 11 月的 65.7% 涨到 2026 年初的约九成。第二是平台的自我转型:MathArena 在 2026 年 5 月官宣告别最终答案类竞赛题——头部模型聚合分已到 90% 以上,短答案题失去了测量意义——转向证明题与研究级题目赛道。第三是最激进的一步:Epoch 的 FrontierMath Erdős 版(2026 年 9 月)把 68 道 2026 年 8 月仍未解决的 Erdős 问题 Lean 形式化后交给模型,每题 300 美元推理预算、72 小时、一次机会;题目由 Erdős 问题清单网站的作者 Thomas Bloom 选定,其中 50 题的数学陈述取自 Google 的 Formal Conjectures 项目,评测脚本全部开源。Lean 机器验证、预算上限、一次机会这一整套设计,直接对着实验室「自测不可复现」的老三样缺口——出题、验证、复现。结果:GPT-6 Astra 解出 2 道(证伪一题、证明一题,得 3%),其余顶级模型全军覆没;加大预算后累计解出至少 5 题、烧掉超 22 万美元算力。Epoch 自己的定语很克制——「AI 驱动的数学突破真实,但仍不常见」。
会考试,不等于会做研究
分数与能力的落差,在 2026 年引来了数学界的公开反弹。9 月 11 日,陶哲轩等 25 位初始签署人(均为菲尔兹奖得主)发表声明,批评 AI 实验室竞逐名题:解题「只是通向概念理解与洞见这一首要目标的工具和代理」,基准驱动的名题攻坚与数学进步整体呈负对齐。这是继当年 ICM 公众报告《Mathematics in the Age of AI》与 6 月初的《莱顿宣言》之后,数学界对 AI 的又一轮集体表态;其直接背景就是几天前 Navier–Stokes 事件的口径之争。出题人 Ken Ono「希望 AI 得零分」的态度,也属于同一种情绪。
陶哲轩本人在个人观点页上给出过更技术性的版本:同一个任务,AI「能不能做」随算力预算、辅助工具与报告口径可以差出数量级,二元判断没有意义;而基准「一旦被逼近,过度优化就会让工具脱离真实用途」。他 2026 年 1 月观察模型做 Erdős 问题的真实成功率,只有一两个百分点,且集中在最简单的子集。
平衡的另一面同样有实据:AIME 2025 考后即测的 95% 到 100% 是干净的进步,没有污染解释的余地;同一时期奥赛级答案题基本被攻克也是事实。所以公允的结论是一条光谱而不是一句话:从训练集里见过的题型,到考后即测的竞赛题,再到未解的研究题,AI 的「数学能力」从接近饱和滑落到接近零——三种说法都真,取决于你站在光谱的哪一段。
小结
数学评测五年走了四代,每一代都在一年内被卷死;污染从传闻变成可测量的机制,评测机构从资助风波里学到了独立性与透明度的必要性,范式则从答案题整体转向证明与开放问题。对读分数的人,两条实操建议:任何没有标注「考后即测」或「私有留出集」的高分,先默认有水分;任何宣传口径的分数,找独立复测再引用。至于「AI 会不会做数学」——它已经会考试了,正在学写证明,离做研究还有整段光谱的距离。
参考资料
- Glazer et al., FrontierMath 论文, arXiv:2411.04872——研究级数学基准的原始设计。
- Epoch AI, FrontierMath 基准页——四档难度、v2 修订与资助声明的官方口径。
- Epoch AI, Clarifying the creation and use of the FrontierMath benchmark(2025-01-23)——资助风波的官方澄清与整改措施。
- Zhang et al., A Careful Examination of Large Language Model Performance on Grade School Arithmetic, arXiv:2405.00332——GSM1k 对照实验,污染的定量实锤。
- Mirzadeh et al., GSM-Symbolic, arXiv:2410.05229——同题换皮与干扰从句的脆弱性测试。
- Balunović et al., MathArena 论文, arXiv:2505.23281——考后即测范式与 AIME 2024 污染检出。
- Epoch AI, Announcing FrontierMath Erdős(2026-09-01)——68 道未解 Erdős 问题的 Lean 形式化评测。
- Terence Tao, Terence Tao on AI in mathematics(个人观点页)——口径、算力与「基准脱离真实用途」的一手表述。
读者留言
COMMENTS 暂无还没有留言,来说第一句?