深度学习是当代工程实践远远跑在理论前面的最大样本:我们用完全说不清机理的系统驱动了上万亿美元的产业。这不是修辞,而是可以精确刻画的技术现状——「一个能预测网络将学到什么」的理论至今不存在,几乎所有理论工作者都承认这条底线。但「没有统一理论」不等于「没有理论」:过去十年,深度学习的每一个标志性怪现象都被数学围剿过一轮,有的被彻底驯服,有的只啃下可解模型的特例。本文按现象盘点这张版图,看看数学到底推进到了哪里。
起点:一个让经典理论失效的实验
2017 年 ICLR 的「Understanding deep learning requires rethinking generalization」(Zhang 等)是这个领域的转折点。作者把 ImageNet 的标签全部随机打乱,网络照样能拟合到训练误差为零——要知道随机标签和图像之间不存在任何可学习的规律,网络是在纯记忆。这一实验宣判了经典统计学习的死刑:以 VC 维为代表的复杂度理论只能证明「这类模型有能力记住一切」,给出的泛化界宽松到与实际表现差着数量级。理论要解释的不再是「模型为什么不过拟合」,而是更刁钻的问题——参数远多于数据的模型里,梯度下降偏偏落到的那个解,为什么恰好是泛化的?
双下降:一条曲线缝起两代理论
第一个像样的回答是双下降。Belkin、Hsu、Ma、Mandal 2019 年发表于 PNAS(预印本 2018)的论文指出:测试误差随模型容量先降后升(经典 U 形曲线),在「插值阈值」——训练误差恰好降为零的位置——附近达到峰值,随后再次下降。一条统一的曲线把经典区间和现代过参数化区间缝在了一起:我们一直活在曲线的第二段里。
同年 12 月,OpenAI 的 Nakkiran 等人把它推广到深度网络,提出「有效模型复杂度」框架:双下降不仅随模型宽度出现,也随训练轮数出现(epoch-wise double descent),甚至发现在插值阈值附近把数据扩大四倍反而损害测试性能——「更多数据有害」这种反直觉现象,在经典理论里连表述都不可能。对实践者的直接含义是:验证集变差未必该停——你可能正站在峰值的左侧,继续训练反而会更好。线性模型这边,Bartlett 等 2020 年的「良性过拟合」给出了严格刻画:协方差谱满足特定条件时,零训练误差的插值解仍能达到近最优的测试误差。局限同样清楚:这些严格结果基本停在线性模型和核方法,深度非线性网络的一般泛化界至今阙如。
NTK:被严格证明的那部分,和它够不着的地方
要说被数学彻底驯服的片段,神经正切核(NTK)是首选。Jacot 等 2018 年 NeurIPS 论文证明:宽度趋于无穷时,网络在训练过程中的行为等价于一个固定核(NTK)上的核回归,训练动力学可以逐层写出,收敛性与泛化界随之可证。Chizat 与 Bach 2019 年的「懒惰训练」从另一头印证了同一件事:大初始化尺度下,参数在整个训练中几乎不动。
严格证明的代价是刻画了一个「假」的世界。Greg Yang 与 Hu 的 Tensor Programs IV(2020)给出要害一击:NTK 极限下网络不学习特征——输入表征从头到尾冻结。而真实的大模型恰恰以特征学习为生,NTK 数学对其并不适用。这条否证线有个意外的正面产出:同一系列(Tensor Programs V,NeurIPS 2021)提出的 μP 参数化让最优超参数可以从小模型零样本迁移到大模型,用约 7% 的预训练算力完成调参就能超过 6.7B GPT-3 的已发表结果,GPT-4 技术报告确认采用了这套方法。深度学习理论迄今最硬的落地,恰恰来自「证明了理论在哪里失效」的那篇论文。
Grokking:小谜题,完整解剖
2022 年初 OpenAI 的 Power 等人报告了一个更怪的现象(grokking):在小规模算法数据集上,网络先完全过拟合、记忆训练集,在训练很久之后验证精度突然从随机水平跳到百分之百。「先背下来,再突然学会」——这违反了几乎所有关于训练动力学的直觉。它之所以重要,是把「泛化是渐变还是突变」这道教科书问答题,变成了可以在受控实验里逐层测量的对象。
这个谜题贡献了机制可解释性方向的标杆工作。Nanda 等 2023 年训练一个单层网络做模 113 加法,把它的权重完整逆向工程出来:网络学的是离散傅里叶变换下的旋转算法,并用「进度度量」把训练拆成记忆、回路形成、清理三个阶段——grokking 不是神秘相变,而是泛化回路缓慢放大、记忆回路被逐步清理的连续过程在精度指标上的突然显形。但普适解释至今没有共识:2025 年 ICML 有工作证明换掉欧氏范数约束 grokking 照样出现,冲击了「权重衰减隐式正则化」的主流叙事;2025 年另有论文把它解释为统计现象;2026 年甚至在纯线性回归里观察到了延迟泛化——连深度结构都不是必要条件。一个小谜题五年没有收敛,恰是整个领域理论现状的缩影。
Scaling Laws:拟合得极好,为什么成立说不清
如果 grokking 是解释滞后的例子,scaling laws 就是「理论缺席但工程照飞」的极致。Kaplan 等 2020 年发现语言模型损失与参数量、数据量、算力呈幂律关系,横跨七个数量级;DeepMind 2022 年的 Chinchilla 修正了配比(计算最优约每参数 20 token),直接改写了整个行业的训练配方。两条经验定律支撑起了数千亿美元的基础设施投资,而它们为什么是幂律,长期没有答案。
近年出现了真正的理论进展。Bahri 等的「Explaining neural scaling laws」(PNAS 2024)在一个可解的随机特征模型中解析导出了幂律,并识别出两个区间:方差受限与分辨率受限——前者由初始化方差主导,后者由数据协方差谱的幂律衰减主导。随机矩阵理论的路线(如 Paquette 等对计算最优 scaling 的「七相」分析)沿着同一思路推进。但这些推导都发生在可解模型里;对真实的 transformer 和真实语料,幂律指数目前没有任何第一性预测能力,甚至有工作发现不依赖数据幂律结构时 scaling law 照样出现——连「谱衰减是根源」这个最流行的解释都还有争议。
炼金术之争,与「学习力学」的宣言
把这些碎片放回时间线,2017 年那场著名的争吵就有了坐标。Ali Rahimi 在 NIPS 2017 时间奖演讲中说「机器学习已经变成炼金术」:batch norm 是标配组件,却没有定理证明它声称的内部协变量偏移机制真的成立;改一下舍入模式,错误率能从约 25% 飙到近 99%。「我们希望把机器学习从炼金术变成电。」LeCun 当场回应「根本不同意」:炼金术士复制配方,深度学习研究者在亲手构建理论,工程先于理论是所有成熟领域的常态。
九年后,正反双方各自壮大。理论落地有了 μTransfer 这样的实绩;可解释性方向把「理解」本身数学化了——Anthropic 2022 年的叠加理论(superposition)把「特征数多于神经元」描述为稀疏字典编码,最优解与权重矩阵奇异值的等差结构相关;渡边澄夫的奇异学习理论(2009)用实对数容许阈值取代参数计数,「发展性可解释性」组织正在把它推向约一亿参数规模的实际测量。2026 年 4 月,14 位作者联署立场文《There Will Be a Scientific Theory of Deep Learning》,宣称一个可称为「学习力学」的学科正在成形,整合泛化、优化、scaling 与可解释性五条线索。宣言能否兑现另说,但把「为什么有效」当作可系统化研究的对象,这个共识本身是新的。
小结:一张理论地图
| 现象 | 已有解释 | 仍然未解 |
|---|---|---|
| 过参数化却泛化 | 双下降(现象学);良性过拟合(仅线性模型) | 深度网络的一般泛化界 |
| 宽网络训练动力学 | NTK / 懒惰训练(严格可证) | 核区间不学习特征,真实模型不在此区间 |
| Grokking | 个案完整逆向工程 + 进度度量 | 无普适解释,非欧范数与线性模型反例 |
| Scaling laws | 可解模型中解析导出幂律 | 真实模型的指数无第一性预测 |
| 为什么这个解被选中 | —— | 完全空白,SGD 隐式偏置缺乏一般理论 |
本文作者判断:深度学习理论的现状不是「没有理论」,而是「理论的适用半径与工程对象的半径严重错位」——严格结果集中在线性、核、无限宽这些理想化极限上,而实践全在区间之外。2017 年的炼金术之争双方都对了一半:Rahimi 要的「电」还没来,LeCun 说的「正在构建理论」也没停。对工程决策者,务实的结论是照常使用这些系统,但把任何「理论保证」类宣传默认打折;对研究者,最大的缺口清单只有一行——解释梯度下降为什么挑中泛化解。
参考资料
- Zhang et al., Understanding deep learning requires rethinking generalization, ICLR 2017——随机标签实验,现代泛化理论的问题起源。
- Belkin et al., Reconciling modern machine learning practice and the bias-variance trade-off, arXiv:1812.11118(PNAS 2019 正式发表)——双下降曲线的原始出处。
- Nakkiran et al., Deep Double Descent, arXiv:1912.02292——双下降推广到深度网络与 epoch 维度。
- Jacot et al., Neural Tangent Kernel, arXiv:1806.07572——无限宽网络等于核方法的严格证明。
- Yang et al., Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer, arXiv:2203.03466——μP 与 μTransfer,理论落地成功的代表。
- Power et al., Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets, arXiv:2201.02177——grokking 现象的原始报告。
- Nanda et al., Progress measures for grokking via mechanistic interpretability, arXiv:2301.05217——模加法算法的完整逆向工程与三阶段拆解。
- Simon et al., There Will Be a Scientific Theory of Deep Learning, arXiv:2604.21691——2026 年「学习力学」学科宣言。
读者留言
COMMENTS 暂无还没有留言,来说第一句?