Scaling Laws 十问十答:算力、数据与参数的交换律

一问:Scaling Laws 到底说了什么

Scaling Laws(缩放定律)研究的是一件朴素的事:模型的参数量、训练数据量、投入算力按比例放大时,模型会变好多快。以语言模型缩放系列研究与后续 Chinchilla 论文为代表的几篇公开经典,给出的核心结论定性一致:模型的验证损失随参数与数据量增加按幂律平滑下降——参数扩大十倍,损失沿一条相当规整的曲线下降一个可预期的幅度,没有突然的相变,也没有明显的收益断层。损失指模型在验证集上的预测误差,是衡量模型能力最通用的代理指标。

二问:为什么偏偏是幂律

没有严格理论能从第一性原理推出幂律,它是一条经验规律:在跨越多个数量级的实验里,损失对参数量取对数后近似一条直线。这个形状的实践价值在于「平滑可外推」——在小模型上测出的直线,可以用来估计大十倍模型的损失,误差在可接受范围内。对一个训练一次动辄巨额算力的行业来说,「训练前就能估算结果」是规划一切的前提。

三问:Chinchilla 修正了什么

早期缩放研究偏重参数:算力翻倍时,优先把模型做大。后来的 Chinchilla 论文指出:同样的算力预算下,参数量与训练数据量应当大致同比放大——「模型很大、数据喂得不足」不是算力的最优用法。这个修正直接改变了行业的训练配方:同等算力下,用更多数据训练相对更小的模型,往往拿到更好的结果。它也解释了为什么「堆参数」的红利期比早期估计的更早遇到数据约束。

四问:6ND 是什么,怎么用

Chinchilla 论文给出的经验公式大致是:训练算力正比于参数量与训练 token 数的乘积,常记作 6ND——N 是参数量,D 是数据量,系数来自对前向与反向传播计算量的估算。它把「算力预算」与「参数×数据」连成一条等式:预算定了,乘积就定了,剩下的问题是乘积内部怎么分配。本站算力的度量衡一文里讨论的租卡成本,除以这个公式就能粗估一个训练计划的规模量级——它是最常用的算力换算器。

五问:数据会不会先到头

会。高质量公开文本的存量有限,而幂律要求数据与参数同比放大——参数可以扩,数据不能凭空印。数据枯竭由此成为缩放的现实约束:行业在用合成数据、多模态数据以及更高效的单位数据利用方式来续期这条曲线。这些手段各自有效,但都改变不了「数据是稀缺资源」这个定性判断。

六问:推理时算力算新的 scaling 维度吗

值得算。test-time compute(推理时计算)指回答时多花算力——更长的思维链、多路采样再筛选——用推理阶段的算力换答案质量。它替代不了训练阶段的缩放(底模不行,想破天也没用),但确实构成了第二条可调节的轴:同一底模,推理算力拉开也能带来可观的提升。本站思维链一文讨论的正是这条轴的机制。行业意义上的 scaling,从「只调训练」扩展成了「训练与推理两个旋钮」。

七问:小模型还有前途吗

有,但要分清两种「强」。蒸馏(让小模型学习大模型的输出)与高质量数据确实能让小模型在特定任务上逼近更大的模型,这是端侧部署与成本敏感场景的基石。但在缩放曲线上,同样的算力投给大模型仍然占优——小模型赢在单位成本的实用性,不赢在能力上限。「小模型够用了」适用于边界清晰的任务,不适用于能力上限的竞赛。

八问:为什么大公司敢提前锁定算力

因为外推可信。正式训练开工前,先用小模型跑出一族缩放曲线,按幂律外推到目标规模,就能在投入巨额算力之前对最终损失有量级正确的预期——不必先造好大模型才知道它行不行。算力采购、数据中心建设这类长周期决策,都建立在「曲线可以外推」这个经验事实上。这与其说是技术,不如说是把不确定性变成可规划风险的经营工具。

九问:对创业者意味着什么

一句话:别把壁垒建在趋势线的必经之路上。凡是「更大模型一出来就会被顺手做掉」的能力——通用问答、常规摘要、浅层代码补全——护城河会随缩放自动被填平。能穿越缩放的壁垒通常在曲线之外:私有数据与领域工作流、分发与信任关系、把模型能力转化为可靠产品的工程细节。Scaling Laws 给「通用能力」的未来价格标了价,创业者的功课是找它标不到价的地方。

十问:一句话总结

Scaling Laws 是这个行业的经验定律与投资时钟:它不能告诉你哪条产品路线会赢,但它规定了通用能力的价格随算力投入可预期地变化——所有关于训练预算、模型选型与商业壁垒的决策,都值得先读一遍这条曲线再做。

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?