高质量公开人类文本被现有训练节奏耗尽的时间点,主流估算落在 2026–2032 年之间,中位约 2028 年;Ilya Sutskever 更是在 2024 年底的 NeurIPS 演讲中断言「我们所知道的预训练将毫无疑问地终结」。但截至 2026-10-10,数据墙并没有以预言的方式到来:它没有变成一次断崖,而是被拆解成三条独立的供给线——存量精耕、增量自造、增量外购。争论的核心已经从「数据会不会用完」换成三个新问题:合成数据靠不靠谱、法律允许用哪些来源、以及谁付得起授权费。本文按这四个问题把 2026 年的格局梳理清楚。先说清分工:本文谈的是预训练侧的数据供给,不是微调阶段的数据工程。
墙有多高:300 万亿 token 的账本
「数据墙」最早的系统性测算是 Epoch AI 的《Will we run out of data?》(arXiv:2211.04325,2022 年首发、2024 年 6 月大修):公开可获取的人类生成文本,过滤后可用的「有效存量」约 300 万亿 token(90% 置信区间 100 万亿到 1000 万亿);若训练数据集的增长趋势延续,将在 2026–2032 年间(中位 2028 年)被充分利用。这份账本有两个容易被忽略的细节。
其一,「耗尽」指的是可用数据的边际枯竭,不是互联网上的字被物理用光。估算里已经计入两个修正因子:精心过滤的网络语料质量可以胜过人工精选语料,把存量上调约 5 倍;同一份数据做多轮训练(multi-epoch)而性能不明显下降,把有效存量再扩大 2–5 倍。墙的真实位置,取决于过滤与重复利用的功夫。
其二,过度训练会把时间表大幅提前。如今头部模型普遍「过训」——数据量远低于算力最优比例(Llama 3-70B 约 10 倍过训)。Epoch 测算:5 倍过训约 2027 年触墙,100 倍过训则在 2025 年就已触顶。反过来,在计算最优的前提下,现有存量大约够训练一个 5e28 FLOP 的模型,这个算力规模预计 2028 年前后就会到达。
关键数字汇总如下:
| 关键量 | Epoch AI 估算(2024 年 6 月版) |
|---|---|
| 公开人类文本有效存量 | 约 300 万亿 token(90% 置信区间 100–1000 万亿) |
| 存量被完全利用的时间 | 2026–2032 年,中位 2028 年 |
| 5 倍过度训练下的耗尽时点 | 约 2027 年 |
| 精心过滤带来的存量上调 | 约 5 倍 |
| 多轮训练带来的有效存量扩大 | 2–5 倍 |
| 索引网页的独特文本 | 约 500 万亿词,到 2030 年约增 50% |
再看图像与视频这个候选增量:按 Epoch 的折算(一张图或一秒视频约折 30 个 token),多模态化确实能把「可读」的存量放大,但他们的结论是现有图像与视频存量不足以填补文本缺口——只能推迟撞墙时间,不能取消这堵墙。
小结:墙的高度没有统一答案,但「公开文本的边际增量正在枯竭」这一方向性判断,在 2026 年已少有争议。
合成数据:把模型自己当矿
第一条破墙之路,是让模型自己生产训练语料。这不是权宜之计的临时发明:Gartner 早在 2022 年就预测,到 2030 年合成数据将在 AI 模型训练中「完全压过」真实数据;微软研究院 2025 年年中提出的 SynthLLM(合成持续预训练)路线,更直接主张可规模化的合成数据生成能够绕开数据墙。
真正让合成数据从「补充」变成「主力」的,是推理模型时代训练范式的变化。以 o 系列与 DeepSeek-R1 为代表的推理模型依赖可验证奖励强化学习(RLVR):模型自己生成海量候选推理链,程序化验证器(单元测试、标准答案比对)自动筛出正确的部分回流训练。数学与代码天然「可自动判分」,因此成为公认能稳定规模化的两类合成语料——Epoch 在 2024 年的判断是合成数据彼时只在数学、编程等狭窄领域可靠;两年过去,可靠性边界有所扩大,但开放域文本仍没有等价的「验证器」,合成数据在那里依旧以蒸馏与改写为主。
这里需要一句区分:预训练侧愁的是「没米下锅」,微调阶段的数据工程愁的是「米怎么配」(配比、去重、过滤的操作细节,站内已有专文展开);两者的合成数据实践也不同——前者追求 token 海量与多样性,后者追求任务对齐与标签质量。
一条重要的反向证据值得记录:2025 年清华大学团队的 pass@k 研究(《Does RLVR Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?》,arXiv:2504.13837)发现,RLVR 更像是在「引出」基座模型已有的能力(小 k 时 pass@1 变好),而非教出真正的新推理(大 k 时基座模型反而更好)。若这一批评成立,靠验证器自造数据的上限,仍然受制于预训练底座见过的东西——合成数据能把现有的矿挖得更深,却未必能变出新矿。
小结:合成数据在可验证领域已是成熟主力,在开放域仍是蒸馏与改写的辅助手段;它的天花板,正是下一节的争论所在。
「近亲繁殖」之争:模型崩溃的证据与反驳
担心模型吃自己的产出导致退化,最著名的证据是 Shumailov 等人 2024 年 7 月发表在 Nature 的论文(《AI models collapse when trained on recursively generated data》,Nature):在递归训练下,生成模型逐代丢失真实分布的信息,分布的尾部(罕见但重要的样本)最先消失,错误被逐代放大。媒体由此把风险概括为合成数据的「近亲繁殖」;这篇论文如今引用已超过两千次,是数据墙叙事里最常被引用的科学基石。
但同样在 2024 年,斯坦福团队的后续研究(arXiv:2404.01413)给出了关键限定:模型崩溃主要发生在「替换」设置下——每代丢掉旧数据、只喂新合成的数据;而只要把真实数据与历代合成数据一起累积保留,测试误差存在与迭代次数无关的上界,崩溃不会发生。作者在多种模型规模与架构上验证了这一结论,并推广到扩散模型与自编码器;另有一篇针对 Nature 论文的注记也批评其实验设置比真实训练狭窄得多。
业界实践实际站在「累积」一侧:没有哪家前沿实验室会丢掉真实语料、只喂模型的自产数据;普遍配方是真实数据打底、合成数据定向补缺、再配严格过滤。Gartner 在给出 2030 年合成数据压过真实数据预测的同时,也警告偏差会被合成过程进一步放大。所以 2026 年的工程共识是把合成数据当「放大器」:它能放大底座的质量,也能放大底座的缺陷;它不能替代真实分布做地基。
小结:「近亲繁殖」在纯递归设置下是真实风险,但在累积式实践下并未被观测到成为主要瓶颈——它更像一条工程红线,而非一道注定的宿命。
法律之墙:版权诉讼把数据供给切成两半
数据墙的第二条裂缝不是物理的,是法律的。2025 年 6 月下旬,加州北区联邦法院连下两判:Alsup 法官在 Bartz 诉 Anthropic 案中认定,用合法获得的书籍训练大模型属于「极具变革性」的合理使用,但 Anthropic 从盗版书库下载 700 多万本书建「中央书库」的行为构成侵权;紧接着 Chhabria 法官在 Kadrey 诉 Meta 案中同样认定训练属合理使用,却刻意把判决建立在更窄的基础上——作者方没能举证「市场稀释」损害,换一个举证充分的原告,结论可能反转。
两案共同划出一条线:训练行为本身在判例上获得初步庇护,盗版获取渠道不被豁免。这条线的价格标签很快出现:Anthropic 就盗版书籍部分达成 15 亿美元的和解——据报道约 50 万本书、每本约 3000 美元,成为美国历史上金额最大的版权和解(2025 年 9 月获初步批准,2026 年 7 月获最终批准,Reuters 报道);且和解只覆盖既往行为,并不包含未来训练的授权。
更受关注的《纽约时报》诉 OpenAI 与微软案,截至 2026-10-10 仍无实体裁决:简易判决文书已在 2026 年 4 月收尾,围绕聊天记录留存与提示词日志的 discovery 之争贯穿 2025–2026 年;2026 年 9 月美国司法部发表立场,认为用作品训练 AI 可以构成合理使用,被普遍解读为对被告方有利。业界主流预期此案以和解加授权协议收场,而非一纸判决。
版权之争对数据供给的实际影响,是把市场切成了两半:拿得到合法授权的一方获得确定性,拿不到的一方转向合成与私有数据。授权市场的规模可以从几笔公开价码感受:News Corp 与 OpenAI 的多年合约据报道超过 2.5 亿美元,Reddit 向 Google 的语料授权约每年 6000 万美元;2026 年 Google 又开启约 20 家出版商的商业试点。「拒售」也在成为姿态:据 Adweek 2026 年 8 月报道,Anthropic 未与任何大型新闻出版商签署授权协议。一个附带效应耐人寻味——有第三方统计发现,与 OpenAI 签约的出版商在 ChatGPT 中被引用的频次显著更高,数据授权正在悄悄变成分发竞价。
小结:版权诉讼没有关死数据之门,但给每一类来源都标了价——合法购买越来越贵,盗版越来越碰不起。
多模态、私有数据与中文语料
在「自造」与「外购」之外,还有两股增量。一是拓宽模态:图像与视频折算成 token 后名义存量巨大,但如前所述,Epoch 测算其不足以替代文本缺口,且折算与训练成本高——2026 年它的角色更多是「稀释墙」而非「推倒墙」。二是私有与垂直数据:企业内部文档、行业数据库、交易与传感器数据不受「公开互联网用尽」的约束,数据标注与数据供应商产业随之扩张,中文世界同样在推动合规语料库建设。
对中文模型而言,数据墙还有额外一层:据 SCMP 2026 年 8 月报道,中国 AI 产业开始明显感受到中文高质量语料相对稀缺的新瓶颈——公开互联网上中文优质文本的占比本就低于英文,而翻译腔的合成中文无法完全替代原生语料的表达多样性。「中文数据墙」因此比全球平均时间表更早进入视野,这也解释了为何国内厂商在合成数据验证与私有语料采购上的投入在 2026 年明显加速。
小结:多模态与私有数据买的是时间与差异化;中文语料的墙来得更早,应对窗口也更窄。
2026 年的数据策略格局
把以上争论收拢,2026 年头部实验室的预训练数据策略大致是三层结构:
- 存量精耕(地基):过滤、去重与多轮重复利用把 300 万亿 token 的账本撑到极限——这是唯一没有争议的共识层。Epoch AI 分析指出 GPT-5 的训练算力低于前代 GPT-4.5、重心转向后训练与更高质量的预训练数据,正是这一层的注脚。
- 增量自造(上层建筑):可验证领域用 RLVR 与蒸馏规模化合成;开放域谨慎掺入,始终以真实数据累积打底,规避「替换式」递归训练的崩溃风险。
- 增量外购(风险对冲):出版商授权与私有数据交易按预算分层购买;判例决定哪些渠道可碰,和解金额决定了违约价格。
四条路线的现状与风险对比:
| 路线 | 代表做法 | 成熟度(截至 2026-10-10) | 主要风险 |
|---|---|---|---|
| 存量精耕 | 高质量过滤、多 epoch 重复训练 | 主流标配 | 重复利用的收益有上限 |
| 合成数据 | RLVR 自造数学/代码、蒸馏改写开放域 | 可验证领域成熟 | 递归崩溃、偏差放大、上限受底座制约 |
| 多模态视频 | 图像视频折 token 并入预训练 | 辅助稀释 | 折算效率低、算力成本高 |
| 授权与交易 | 出版商授权、私有语料采购 | 快速扩张、头部集中 | 单价高、法律不确定性尚存 |
数据墙争论至今的关键节点,收进一张时间线:
graph LR
A["2022年10月 · Epoch 首发估算"] --> B["2024年6月 · 大修:300万亿token与2026至2032区间"]
B --> C["2024年7月 · Nature 发出模型崩溃警告"]
C --> D["2024年12月 · Sutskever 断言 peak data"]
D --> E["2025年6月 · 两起合理使用判例落地"]
E --> F["2025年9月 · Anthropic 15亿美元和解"]
F --> G["2026年4月 · NYT案简易判决文书收尾"]
G --> H["2026年9月 · 美司法部发表有利意见"]
回到最初的问题:高质量数据什么时候用尽?2026 年最诚实的回答是——作为「公开免费文本」的那口井,边际水位确实在下降;但数据策略早已从打井转向修渠:自造、外购、精耕三渠并行,墙被拆成了成本问题与法律问题。Epoch 的中位估算(2028 年)意味着的更多是「免费午餐结束」,而不是「规模化结束」。真正悬而未决的是两件事:开放域合成数据何时获得等价于「验证器」的质量闸门,以及 NYT 案的结局会把授权市场的价格定在哪里——这两件事的答案,大概率都会在 2027 年之前揭晓。
参考资料
- Epoch AI:Will we run out of data to train large language models?——数据墙估算的一手来源:300 万亿 token 存量、2026–2032 耗尽区间与多轮训练修正。
- Villalobos 等:Will we run out of data? Limits of LLM scaling based on human-generated data——上述估算的论文版,含置信区间与过度训练敏感性分析。
- Shumailov 等:AI models collapse when trained on recursively generated data——模型崩溃警告的 Nature 2024 原始论文。
- Gerstgrasser 等:Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data——对模型崩溃的关键限定:累积式训练不会崩溃。
- Yue 等:Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?——RLVR 自造数据上限之争的 pass@k 证据。
读者留言
COMMENTS 暂无还没有留言,来说第一句?