为什么给大模型更多文本,它的预测误差常会沿一条平滑曲线下降?过去,神经缩放定律主要是一条好用的经验规律:增加训练数据、参数或算力,模型通常会按幂律继续改善。JMLR 这篇论文试图把曲线的源头追到语言本身,而不只停在实验拟合。
作者从 Zipf 定律出发——少数词极常见,大量词落在长尾;再推出 Heaps 定律,即文本越长,新词仍会出现,但速度逐渐放慢。随后借 Hilberg 假说,把词汇增长连接到文本中可预测结构的增长,最终推到基础模型的交叉熵率如何随训练 token、参数和计算量缩放。交叉熵率可以粗略理解为模型预测下一个词时平均还剩多少不确定性。
关键不在于四条规律分别成立,而在于论文给出了一条逐步展开的推导链。作者还用 Santa Fe process——一个简化的随机文本过程——展示四条规律可以同时成立。不过,据 JMLR 论文说明,这一结论依赖一组明确假设,并不意味着任何语言和模型都会无条件遵循同一条链。