深度学习入门

缩放定律:为什么「大」真的有用

14 分钟

深度学习史上,「把模型做大」很多时候会遇到收益递减。但语言模型不一样——它的性能提升表现出惊人的规律性。


缩放定律说了什么

研究发现,语言模型的损失和三个量之间存在幂律关系

  • :参数量
  • :训练数据量
  • :计算量

在对数坐标下,它们是一条直线。 这意味着:

只要你告诉我打算用多少算力,我就能相当准确地预测出模型能达到什么损失。

这在工程上是革命性的——花几亿训练一个模型之前,可以先用小模型拟合曲线,外推出大模型的效果。它把「碰运气」变成了「可规划」。


一个关键修正:参数和数据要配平

早期的做法偏向「把模型做大、数据相对少」。后来的研究(Chinchilla 工作)指出这是次优的:

在固定算力预算下,参数量和数据量应该按大致相同的比例一起增长。

换句话说,很多早期的大模型是「训练不足」的——同样的算力,用小一点的模型配更多数据,效果更好。

这个结论直接改变了后续模型的设计:参数量增长放缓,训练数据量大幅增加。


涌现能力:不连续的跳变

缩放定律描述的是损失的平滑下降。但在具体任务上,观察到了另一种现象:

某些能力在小模型上几乎为零,模型规模越过某个临界点后突然出现

典型的例子包括多步算术、逻辑推理链、根据指令完成没见过的任务。

这叫涌现(emergence)。

一个重要的学术争议:有研究指出,涌现可能部分是评测指标造成的假象——如果用「完全正确才算分」这种非连续指标,能力的连续提升会显得像突变;换成更平滑的指标(如部分正确得分),曲线就没那么陡了。

这个争论还没有定论。 但无论如何,「规模带来质变」这个现象本身是真实存在的。


缩放不是免费的:三堵墙

① 数据墙

高质量文本是有限的。当训练数据量接近互联网上可用的高质量文本总量时, 就没法继续放大了。这催生了合成数据、数据配比优化等方向。

② 成本墙

训练成本大致随参数量和数据量的乘积增长。成本增长是超线性的,而收益是幂律的(越来越慢)——总有一个点,多花十倍钱换不来值得的提升。

③ 推理墙

模型训练一次,但要服务数十亿次请求。参数翻倍,每次推理的成本也翻倍。

这就是为什么行业重心从「训得更大」转向了「同样能力下推理更便宜」——蒸馏、量化、混合专家(MoE)等技术都是在攻这一点。第八节会详细讲。


混合专家(MoE):一个绕开推理墙的思路

核心想法:总参数很多,但每次只激活一小部分。

把 FFN 层换成 个「专家」网络 + 一个路由器,每个 token 只送到其中 1–2 个专家。

结果:总参数量可以做到很大(知识容量大),但每次推理的实际计算量只相当于一个小模型

代价:显存要装下全部专家、训练时负载均衡不好调、工程复杂度高。


这一节的意义

缩放定律解释了过去几年发生的事:不是有人发明了新的智能算法,而是同一个架构被放大了几个数量级。

同时它也预示了下一阶段:当三堵墙都逼近时,单纯放大不再奏效,重心必然转向数据质量、训练方法和推理效率——这正是当前的研究前沿。

练习:解释一下——为什么「推理墙」比「训练成本墙」对一个真实产品来说更致命?

小纸条

缩放定律在工程上的革命性意义是什么?「参数和数据要配平」这个修正说明了什么?

登录 后可看答案