什么是 Scaling Law?大模型「越大越强」的底层规律
为什么各家敢砸几十亿训练模型?Scaling Law 是什么、参数量数据量算力该怎么配、为什么说它开始撞墙,以及推理时计算这条新曲线,一文讲清。
有个问题一直没人正面回答过:各家凭什么敢在一次训练上砸下几亿甚至几十亿美元? 万一钱花完了模型没变强呢?
答案是他们心里有底——Scaling Law(规模定律) 告诉他们,投入和效果之间存在一条可预测的曲线。这篇讲清这条曲线是什么、为什么现在开始失灵,以及行业转向了哪里。
一句话理解:投入越多,效果越好,而且能算出来好多少
Scaling Law 说的是:模型的表现,和参数量、训练数据量、算力这三者之间,存在稳定的数学关系。
关键不在”越大越强”这个常识,而在可预测三个字:
在小规模上做几次实验,就能相当准确地推算出——如果把规模放大一百倍,模型会强到什么程度。
这件事的意义怎么强调都不过分。它把”训练大模型”从一场赌博,变成了一笔可以做财务测算的投资。 没有它,没人敢签那种规模的算力订单。
三个变量要配比,不是只堆一个
早期有个普遍的误解:以为把参数量堆上去就行。后来的研究纠正了这一点——参数和数据要按比例一起涨,否则就是浪费。
打个比方:
- 参数量像学生的脑容量
- 训练数据像给他看的书
- 算力像学习的时间
一个脑容量惊人但只读过十本书的学生,考不过一个脑子普通却读了几千本书的。早期不少模型正是”脑子太大、书太少”,参数给足了,数据却没喂够,能力远没发挥出来。
业内后来给出的经验配比大致是:每一个参数,配约 20 个 token 的训练数据。这个结论直接改变了行业做法——同样的预算,与其把模型做得更大,不如做小一点、喂更多数据。
残酷的地方:这是幂律,不是线性
Scaling Law 是一条幂律曲线,这意味着收益递减得非常快。
粗略地说,想让模型的表现再提升一个档次,投入往往要翻十倍。前期投入的效果立竿见影,越往后越费劲:
| 阶段 | 投入 | 效果 |
|---|---|---|
| 早期 | 10 倍算力 | 提升明显 |
| 中期 | 100 倍算力 | 提升可感 |
| 后期 | 1000 倍算力 | 提升有限 |
所以你会看到一个现象:顶尖模型之间的差距越来越小,但为了这一点点差距烧掉的钱越来越多。这也解释了为什么各家跑分榜单上的分数挤在零点几分之内——不是不想拉开,是拉不开。
顺带一提,规模上去后会出现一些没被专门训练的能力(推理、翻译、写代码)自己冒出来,业内叫涌现,具体机制见大模型是怎么工作的。
为什么说它开始撞墙
这两年”Scaling Law 失效了吗”的讨论越来越多。真正的瓶颈有两个:
一是数据不够了。 互联网上的高质量文本是有限的,而且已经被扒得差不多了。参数还能继续堆,但”每个参数配 20 个 token”的另一半——数据——快见底了。用 AI 生成的合成数据来补是目前的主要出路,但它在哪些领域真的有效、又会带来什么副作用,是另一个话题。
二是成本涨不动了。 幂律意味着下一档提升要十倍投入,而算力、电力、资金都不是无限的。这不是技术上做不到,是经济上不划算了。
新的一条曲线:把算力花在推理时
行业的应对方式很聪明——既然训练时堆规模越来越贵,那就换个地方堆。
这就是推理模型的思路:模型回答难题前先在内部”想”很久,用推理时的额外计算换取准确率。同样一个模型,让它多想十倍时间,难题正确率会明显上升。
于是 Scaling Law 有了第二条曲线:从”训练时投多少”,变成”回答时想多久”。这也是为什么这两年各家旗舰都在强调”深度思考”模式——那不是营销词,是算力投放位置的转移。
同一时期还有另一条省钱路线:MoE 架构让模型总参数很大但每次只激活一小部分,知识蒸馏和量化则让小模型也能打——它们和推理时计算一起,构成了”后 Scaling Law 时代”的主要方向。
对普通用户意味着什么
- 别迷信参数量。配比没做好的大模型,打不过训练充分的小模型,开源小模型这两年越来越能打就是证明。
- 顶尖模型的差距在缩小。选谁更多看你的具体场景和价格,而不是谁排行榜第一。
- “深度思考”值得为难题打开。那是真的在多花算力,日常问题则没必要,慢还贵。
小结
Scaling Law 的核心是:模型能力与参数量、数据量、算力之间存在可预测的幂律关系——正是这份可预测性,让大模型从科研项目变成了能做财务测算的工业投资。
但幂律也意味着收益递减:下一档提升要十倍投入,而高质量数据快用完了。于是行业把算力从训练端挪到了推理端,用”想得更久”替代”练得更大”。理解了这条曲线,你就能看懂过去几年模型为什么疯狂变大,以及现在为什么突然都开始强调”会思考”。