机器学习简史(三):AlexNet 点火,深度学习黄金五年

2012 年 10 月,ImageNet 大规模视觉识别挑战赛(ILSVRC)的成绩单上出现了一个不和谐的数字:一支名叫 SuperVision 的队伍把 top-5 错误率压到 15.3%,而第二名还停在 26.2%。赢得这么多的秘密不是什么新理论,而是一个 1998 年就有了雏形的卷积神经网络——只是这次它足够深、跑在两块游戏显卡上、吃着足够多的数据。这就是 AlexNet,深度学习的「点火时刻」。此后五年,这个领域经历了历史上最密集的突破期:机器在图像识别上越过人眼基准、学会翻译、学会生成图像,然后在三亿观众面前赢下了围棋。本篇讲这五年。

ImageNet:先有数据,才有革命(2009)

革命开始之前,先得有人备好燃料。2009 年,斯坦福大学的李飞飞团队在 CVPR 发表《ImageNet: A Large-Scale Hierarchical Image Database》——用 WordNet 的概念树组织、靠众包标注的巨型图像库。这个当时并不起眼的工作,最终长成 1419 万余张标注图片、覆盖 21841 个概念类别(ImageNet 官网现势口径)的数据集,并从 2010 年起举办年度竞赛 ILSVRC:给定 1000 类、百万级图片,比谁分类错误率低。2010 年冠军错误率 28.2%,2011 年 25.8%——用当时主流的「手工特征 + SVM」范式,两年只挪动了两个百分点。

现在回头看,ImageNet 的真正洞见是方法论层面的:当所有人都认为算法更重要的年代,它押注「数据规模本身即是算法能力的一部分」。这个判断在当时被不少同行视为浪费资源——一百多个类目、上千万张图,标注成本天文数字。但正是这种「笨功夫」,为下一个算法准备好了试金石。

AlexNet:一次寒碜却彻底的胜利(2012)

AlexNet 论文《ImageNet Classification with Deep Convolutional Neural Networks》(Krizhevsky、Sutskever、Hinton,NIPS 2012)的成绩单在摘要里写得干脆:「15.3% 的 top-5 测试错误率夺冠,第二名是 26.2%」(官方竞赛记录中冠军成绩为 16.4%,论文与官方口径略有差异,本文以论文口径为准)。这篇论文的每个组件今天看都平平无奇:8 层网络、6000 万参数、ReLU 激活(论文实验显示比 tanh 收敛快数倍)、Dropout 正则化,外加作者自己写的 CUDA 实现——「我们的网络在两块 GTX 580 3GB GPU 上要训练五到六天」。用今天动辄数万卡集群的标准看,这次革命的成本寒碜得近乎可爱。

但它的意义在于改宗:全领域用一年时间完成了路线切换。2013 年冠军(ZFNet,仍是卷积网络)错误率 11.7%,2014 年 GoogLeNet 6.7%——而论文测量的人类标注者基准约 5.1%。也就是说,短短三年,机器图像识别从「远不如人」直接逼近「与人相当」。「深度学习」一词取代了此前一切的自我介绍:不说自己是做神经网络的了,改说做深度学习。上一篇里那批在统计学习阴影下蛰伏的人(LeCun、Bengio、Hinton),一夜之间成了时代主角。

越过人眼:ResNet 与深度的魔法(2015)

2013 年之后,研究者发现网络越深效果越好——但 depths 加到二十几层后训练就开始崩溃,梯度在反传过程中消失或爆炸。2015 年 12 月,微软亚洲研究院的何恺明等人在 arXiv 贴出《Deep Residual Learning for Image Recognition》:给网络加上「残差连接」,让每一层只需学习相对输入的修正量而非完整变换。这篇论文的成果记录在摘要里:最多 152 层的残差网络拿下 ILSVRC 2015 分类冠军,集成模型 top-5 错误率 3.57%——首次明显越过约 5.1% 的人眼基准线。论文正式发表于 CVPR 2016,并横扫当年检测、定位、分割多个赛道。

残差连接的意义远不止刷榜,它如今是几乎所有深层网络(包括 Transformer)的标配结构。顺带记录同期视觉线的尾声:ILSVRC 办到 2017 年停办,冠军 SENet 错误率已到约 3% 以下——在 ImageNet 这个特定基准上,竞赛的历史使命完成了。

序列的觉醒:翻译、注意力与强化学习(2013–2015)

图像之外,序列问题也在悄悄酝酿另一场革命。2013 年 1 月,Google 的 Mikolov 等人发表 word2vec 论文(arXiv:1301.3781),用浅层网络把单词映射成向量,「国王减去男人加上女人约等于女王」的向量运算成了十年内最出圈的机器学习演示——语义第一次变成了可以计算的几何。2014 年,Sutskever、Vinyals 与 Le 用多层 LSTM 搭出端到端的编码器-解码器结构(seq2seq,arXiv:1409.3215),英法翻译 BLEU 值达到 34.8,超过传统统计机器翻译基线;同年 9 月,Bahdanau、Cho 与 Bengio 在 arXiv:1409.0473 中指出固定长度向量的信息瓶颈,让解码器在生成每个词时「回看」源句的相关部分——这个机制叫注意力。当时没有人想到,四年后它会成为一切的主角。

第三条战线来自游戏。DeepMind 2015 年 2 月在《Nature》发表 DQN(Human-level control through deep reinforcement learning):同一套卷积网络加强化学习算法,只看像素和得分,在 49 款雅达利 2600 游戏上达到专业人类测试员水平,部分游戏里「想出」了人类玩家没发现的高分策略。这篇论文证明深度强化学习可以端到端地从原始感知学到决策——它是通往下一篇 AlphaGo 的直通车。

GAN:让机器学会「无中生有」(2014)

2014 年 6 月,Goodfellow 等人贴出 arXiv:1406.2661《Generative Adversarial Nets》:让生成器伪造数据、判别器鉴别真伪,两者对抗训练直至伪造难辨。推导干净利落——不需要马尔可夫链采样,纯靠反向传播,理论解处判别器恰好输出 0.5。GAN 的影响力在随后数年爆发:从生成人脸到风格迁移,「对抗训练」成了生成模型代名词,LeCun 在 2016 年 Quora 问答里称对抗训练是「自切片面包以来最酷的东西」(the coolest thing since sliced bread;另一句流传更广的「二十年来看过的最酷的机器学习想法」出自其演讲转述,措辞有多个版本)。GAN 后来部分让位于扩散模型,但「生成 vs 判别」的对抗思想已经写进了生成式 AI 的基因。

AlphaGo:三亿人围观的认知冲击(2016)

如果说 AlexNet 改变的是行业,AlphaGo 改变的就是公众。先有一手铺垫:2015 年 10 月,DeepMind 的 AlphaGo 在无人直播的比赛中 5:0 击败欧洲围棋冠军樊麾(成果发表于 2016 年 1 月 27 日《Nature》——《Mastering the game of Go with deep neural networks and tree search》),成为第一个不借让子战胜职业棋手的程序。围棋长期被视为「机器不可能染指」的最后堡垒:19×19 棋盘的合法局面数远超宇宙原子量级,暴力搜索毫无希望,彼时学界共识是最强程序也只有业余高段水平。

2016 年 3 月 9 日至 15 日,首尔四季酒店,AlphaGo 对李世石九段——全球超过 2 亿人观看直播。比分最终 4:1:第二局 AlphaGo 落下的第 37 手一度被人类棋手误认为误着,实为大局观深远的妙手;第四局李世石下出第 78 手「挖」,据 DeepMind 事后分析当时评估系统给 AlphaGo 的胜率判断瞬间崩塌,这一手被棋手古力命名为「神之一手」,为人类留下唯一一局胜利。年底,升级版以「Master」账号在在线对弈平台横扫中日韩顶尖棋手 60 连胜;2017 年 5 月乌镇 3:0 胜柯洁后退役。收官之作更耐人寻味:2017 年 10 月《Nature》的 AlphaGo Zero 完全抛弃人类棋谱,仅靠自我对弈,训练三天即以 100:0 击败战胜过李世石的旧版——「不依赖人类知识」从此成了新的野心标尺。

基建定型与「炼金术」之争(2015–2017)

黄金五年的另一个支点是基建。2014 年 NVIDIA 发布 cuDNN 深度学习加速库;2015 年 11 月 9 日 Google 宣布 TensorFlow 开源(Apache 2.0 协议);Facebook 2016 年 9 月启动 PyTorch 项目、2017 年 1 月公开发布——深度学习从此从「会写 CUDA 的少数人的手艺」变成了「pip install 一下的学生技能」。2015 年 5 月,LeCun、Bengio、Hinton 三人在《Nature》联名发表综述《Deep learning》,为这波浪潮盖章定论:深度表示学习带来图像、语音、文本的全面突破,驱动因素正是「海量数据、GPU 算力与算法改进」的三要素汇合——这篇综述成了「黄金五年」叙事的权威锚点。

但浪潮内部并非没有杂音,最有名的一场发生在 2017 年 12 月的 NIPS 大会。图灵奖级别的 Test of Time 奖得主 Ali Rahimi 在获奖演讲中直言「机器学习已经变成炼金术」(machine learning has become alchemy):效果在涨,但我们对 batch norm 这类广泛使用的技术「几乎一无所知」;他呼吁同行「把机器学习从炼金术变成电学」。LeCun 当场在社交媒体反驳:那些被贬为炼金术的实践其实叫「工程」,科学史从来都是工程先于理论(热机早于热力学)。这场争论没有胜负,但它是此后所有「深度学习可解释性」「大模型是否理解世界」之争的预演——第四篇里我们会看到,同样的争论在大模型时代被放大了百倍。

timeline
    title 2012-2017 关键事件时间线
    2012 : AlexNet夺冠,15.3%对26.2%
    2013 : word2vec,冠军11.7%
    2014 : GAN与seq2seq,cuDNN发布
    2015 : ResNet 3.57%越过人眼,DQN上Nature
    2016 : AlphaGo 4比1胜李世石
    2017 : AlphaGo Zero自学100比0,Transformer前夜

系列导航

  • 第一篇:1943–1986,从图灵之问到两次寒冬
  • 第二篇:1986–2012,反向传播复兴与统计学习的中场三十年
  • 本篇:2012–2017,AlexNet 点火,深度学习黄金五年
  • 第四篇:2017–2026,Transformer 之后,大模型时代

参考资料

  1. Krizhevsky, Sutskever & Hinton (2012), ImageNet Classification with Deep Convolutional Neural Networks, NIPS——15.3% vs 26.2%、双 GPU 训练等核心数字的一手出处。
  2. Deng 等 (2009), ImageNet: A Large-Scale Hierarchical Image Database, CVPR 与 ImageNet 官网——数据集规模与竞赛背景。
  3. Russakovsky 等 (2015), ImageNet Large Scale Visual Recognition Challenge, IJCV——历届冠军错误率与 5.1% 人眼基准的权威来源。
  4. He 等 (2015), Deep Residual Learning for Image Recognition, arXiv:1512.03385——152 层、3.57% 与 ILSVRC 2015 冠军记录。
  5. Mnih 等 (2015), Human-level control through deep reinforcement learning, Nature 518——DQN 与 49 款雅达利游戏。
  6. Silver 等 (2016), Mastering the game of Go with deep neural networks and tree search, Nature 529——AlphaGo 5:0 胜樊麾的一手出处;人机大战细节另见 Wikipedia: AlphaGo versus Lee Sedol。
  7. LeCun, Bengio & Hinton (2015), Deep learning, Nature 521——「三要素汇合」叙事的权威综述。
  8. Ali Rahimi, NIPS 2017 Test-of-Time Award 演讲实录——「炼金术」之争的逐字稿。
← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?