AI 开始发现新数学了吗:从 FunSearch 到 AlphaEvolve

2023 年 12 月之前,「AI 做数学」的主流叙事是刷题:把人类出好的题做对,分数再高也只是解题速度的差异。FunSearch 改变了这件事的性质——它交出的不是答案,而是人类此前不知道的构造。此后两年,这条「机器发现」路线一路推进到 2026 年:矩阵乘法指数的纪录被刷新,陶哲轩开始把 AlphaEvolve 当成日常工具,连 Erdős 问题清单上也出现了「方法来自大模型输出」的注脚。本文回答三个问题:AI 到底「发现」了什么新数学?这些结果是怎么被找出来的?以及——它们经得起多大程度的推敲。

先分清两种「AI 做数学」

讨论之前先把概念切开。「AI 解题」是对着已知答案或已知可判定的问题求解,奥数、竞赛题、基准测试都属于这一类,判据是分数;「AI 发现」则是产出人类此前不掌握的对象——新的构造、新的界、新的算法,判据不再是「对不对」,而是「新不新、可不可验证」。后者的门槛其实更硬:一个构造摆出来,任何人都可以拿评估器验证它,造假空间比考试小得多。这也是为什么这条路线虽然产量不高,说服力却很强。

发现也有三种形态:改进已知问题的界或构造(cap set、kissing number)、发现新算法(矩阵乘法、调度与内核优化)、以及最罕见的「提出人类没想到的证明思路」。下面按时间线看这三个台阶。

FunSearch:第一次越过人类已知最好成绩

2023 年 12 月 14 日,DeepMind 在 Nature 发表 FunSearch(Romera-Paredes 等人),副标题就是「来自程序搜索的数学发现」。它的主角问题叫 cap set:在 n 维格点上选一个点集,每个坐标只能取 0、1、2,要求任何三个点都不构成等差数列——直观理解,就是卡牌游戏 Set 里凑不出「三张同维同值」组合的最大牌组。这个问题看着玩具,却是加性组合数学的核心对象,与著名的三个素数定理有血缘关系。

FunSearch 在 n=8 时构造出了 512 个点的集合,把此前已知的最佳构造(Edel 的 496 个点)向上推了一步;渐近意义上的「容量」下界也从 2.2180ⁿ 提到 2.2202ⁿ,Nature 摘要称之为该问题二十年来最大的渐近下界改进。注意这是「地盘扩张」而非「盖棺定论」——n=8 的真正最大值仍未知,渐近上界(Ellenberg–Gijswijt,约 2.756ⁿ)也还远没有触及。同一位「发现者」顺手还改进了在线装箱启发式:在十万件物品的大规模 Weibull 实例上,它给出的装箱方案超出最优下界仅 0.03%,对照组 best-fit 算法是 3.79%。

原理:只进化一个函数,其余交给评估器

FunSearch 的机制出乎意料地朴素:冻结的大语言模型(基于 PaLM 2 的 Codey)负责提出程序修改,自动评估器负责打分,岛屿式进化数据库负责筛选下一代种群,前后采样约百万次、全程不做微调。关键设计是只进化程序中的一个小函数——比如装箱里的「下一个物品放哪」优先级函数——其余框架代码保持不变。这样产出的是人类可读、可简化、可验证的程序:cap set 那个 n=8 的优先级程序,事后还被研究人员手工简化成了一个显式构造。

AlphaEvolve:从进化一个函数到进化整个代码库

2025 年 5 月 14 日,DeepMind 发布 AlphaEvolve,配套白皮书于 6 月挂上 arXiv(编号 2506.13131)。它把 FunSearch 的套路放大了一号:LLM 集群(Gemini Flash 管广度采样、Gemini Pro 管深度打磨)提议修改,对象从「一个函数」升级为「整个代码库」,评估器闭环不变。

数学侧最响亮的结果是矩阵乘法:AlphaEvolve 找到了把两个 4×4 复数值矩阵相乘只需 48 次标量乘法的算法,改写了 Strassen 1969 年以来保持 56 年的 49 次纪录。这里有两个限定词必须划重点。其一,复数值——Strassen 算法在任何域上都成立,而这个 48 次算法依赖复数结构,随后 Dumas 在 2025 年 6 月补出了只用有理系数的版本,才算把短板填齐。其二,56 年指的是这一固定尺寸纪录,它不等于复杂度指数 ω 的纪录(见下文)。几何侧,AlphaEvolve 把 11 维 kissing number(相邻能与一个单位球同时相切的最大球数)的下界从 592 提到 593——这一维的精确值如今夹在 593 与 594 之间,仍待定夺。

白皮书给出的开放问题成绩单值得原样记住:在五十多个来自分析、几何、组合、数论的开放问题上,约 75% 重现了已知最优解,20% 改进了已知最优解,其余更差。工程侧的数字更「性感」:数据中心调度启发式上线一年,平均持续找回 Google 全球算力资源的 0.7%;把 Gemini 训练中的关键矩阵乘法内核加速 23%,折合训练总时间缩短约 1%;FlashAttention 内核最高加速 32.5%。

系统 时间 搜索什么 代表结果
Ramanujan Machine 2021 常数的连分数表示 批量生成关于 π、e 的新猜想,证明留给人
AlphaTensor 2022 张量分解算法 模 2 上 4×4 矩阵降到 47 次乘法
FunSearch 2023 程序里的关键函数 cap set 下界 496 → 512
AlphaEvolve 2025 整个代码库 4×4 复矩阵 48 次;11 维 kissing number 593
ShinkaEvolve 2025 样本高效的开放式进化 150 次评估刷新 26 圆装箱 SOTA

2025 到 2026:发现流程开始变成生态

后续一年的进展比很多人预期得快,而且出现了「人类反超」的花絮。Sakana AI 的 ShinkaEvolve(2025 年 9 月)走样本效率路线,只用 150 次评估就刷新了 26 圆装单位圆问题的最优解——AlphaEvolve 用远多于 150 次的评估才把同一个指标推进 0.001。人类这边,Aalto 大学的研究生 Ganzhinov 用独立方法把 11 维 kissing number 做到 592,恰好比 AlphaEvolve 的 593 差一步。

真正的分水岭是陶哲轩入伙。2025 年 11 月,Georgiev、Gómez-Serrano、陶哲轩与 Wagner 的论文把 AlphaEvolve 对准 67 个分析、组合、几何问题:约 20 个得到新结果,包括重现 Gerver 沙发的最优解、给出 3 维沙发新设计,以及小幅打破 3 维有限域 Kakeya 集的构造纪录——这个改进随后被 Gemini Deep Think 证明,并用 Lean 形式化。AI 找构造、AI 证构造、机器验构造,第一次串成了一条龙。

2026 年又上了三个台阶。其一,矩阵乘法指数 ω 的上界从 2.371339 降到 2.371177 以下(arXiv 编号 2608.16884,作者阵容里有算法复杂性方向的旗手 Vassilevska Williams),AlphaEvolve 是其中三大方法之一——注意主要推进来自激光法组合损失的分析,AI 是「精炼优化算法」的角色,这与宣传口径的分工不同。其二,Erdős 问题 #1196 等一批 1966 年猜想的证明里,论文摘要明确写出核心方法「由 GPT-5.4 Pro 的输出提示」,陶哲轩是共同作者——「AI 出思路、人类完成证明」有了第一个高规格样板。其三,争议最大的 OpenAI Navier–Stokes 事件:2026 年 9 月宣布「AI 生成解 + Lean 形式化证明」,但它走的是 Clay 官方问题陈述里允许外加力项诱发爆破的版本,千禧年主问题并未解决(该事件的优先权之争,本站此前的专题文章已详述,此处不展开)。

这算「发现」吗:批评者的三个理由

结果本身没什么可争议的——构造可验证、算法可复现,48 次乘法还被社区独立复核过。争议集中在「发现」这个词的分量上。

理由一:幅度与实用性。 49 到 48 只省一次乘法,而且 4×4 固定尺寸构造对应的渐近指数约为 2.79,远高于已知的 ω 纪录 2.3712 以下,对实际计算没有性能意义;「复数值」限定也让标题弱于字面。数学社区(Hacker News、MaplePrimes)在发布当天就有这类讨论。

理由二:METR 的「无加速」清单。 2026 年 8 月,METR 的研究笔记考察了七条算法优化指标的时间序列(nanoGPT、CIFAR-10 训练、Gurobi、MIPLIB、Stockfish、ω 指数等),没有一条显示出 AI 带来的加速;笔记还点破了一个容易被忽略的事实——表面上的「通用提示做出发现」,可能隐藏着「在选择问题、验证解时所用的人类专业能力」。ω 的每一步推进都对应人类证明,就是这条观察的注脚。

理由三:陶哲轩的亲历者观察。 他与自己团队 67 个问题的复盘说得相当直白:AlphaEvolve 擅长发现那些「本就在现有数学射程之内、只是前人没花时间去找」的构造;对于需要真正新的深层洞察才能前进的问题,「很可能不是合适的工具」。他还提醒,AlphaEvolve「极其擅长钻验证代码的空子」,数值上的漂亮结果可能是验证器漏洞的产物而非真进展——盲信有风险。

把三份批评放在一起,本文作者的判断是:它们并不否定结果的真实性,质疑的是叙事的高度。目前的机器发现更接近「把人类数学的已勘探区域搜索得更密」,尚未出现由 AI 独立完成的概念跃迁;但「陶哲轩把它当日常工具用」这件事本身,已经足以让它留在研究议程的核心位置。

小结

从 FunSearch 到 AlphaEvolve 再到陶哲轩的 67 题实验,机器发现这条路线两年里完成了「方法验证 → 工具化 → 进入数学家工作流」的三级跳,代表成绩是 cap set 512、4×4 矩阵乘法 48 次、kissing number 593 和一串 Erdős 问题的推进。它的真实画像不是「机器数学家」,而是一台不知疲倦的构造搜索机:搜索空间由人类圈定,验证标准由人类设计,产出是否「深刻」仍由人类裁决。下一块试金石已经清晰可见——它能不能在没有人类提示的方向上,自己选一个值得攻的问题。

参考资料

  1. Romera-Paredes et al., Mathematical discoveries from program search with large language models, Nature, 2023-12-14——FunSearch 原始论文,cap set 与装箱结果的权威出处。
  2. AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms(Google DeepMind 官方博客,2025-05-14)——48 次乘法、kissing number 593 与工程数字的官方口径。
  3. Novikov et al., AlphaEvolve: A coding agent for scientific and algorithmic discovery, arXiv:2506.13131——白皮书,「75% 复现、20% 改进」成绩单出处。
  4. Georgiev, Gómez-Serrano, Tao, Wagner, Mathematical exploration and discovery at scale, arXiv:2511.02864(陶哲轩博客导读)——67 题实验与「现有射程之内」的亲历者评价。
  5. Dupont et al., Improving the matrix multiplication exponent with modern optimization and AlphaEvolve, arXiv:2608.16884——ω 上界降到 2.371177 以下的最新纪录。
  6. Alexeev et al., Primitive sets and von Mangoldt chains: Erdős Problem #1196 and beyond, arXiv:2605.00301——「方法由 GPT-5.4 Pro 输出提示」的高规格证明样板。
  7. Cunningham & Rush, Have We Seen an Acceleration in Discoveries?(METR,2026-08-14)——七条时间序列无加速证据的批判性考察。
  8. Sakana AI, ShinkaEvolve(官方博客,2025-09)——150 次评估刷新 26 圆装箱的样本效率路线。
← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?