你的技术前沿之旅,从这里开始
预训练阶段与规模定律
规模定律描述的是可预测性,不是"越大越好"的保证。

一、规模定律说的是什么
预训练损失随模型规模、数据量与计算量呈现可预测的幂律关系。这项工作的价值在于在给定算力预算时,可以估算如何分配模型规模与训练数据,而不是盲目扩大其中一个维度。
二、计算最优与参数最优不是一回事
后续研究指出,固定算力下存在一个计算最优的模型规模与数据量组合,小模型配更多数据往往优于大模型配少量数据。这修正了"参数越多越好"的直觉。
三、数据质量与数据数量的权衡
规模定律假设在固定质量水平下增加数据。更进一步的工作指出,提高数据质量带来的收益可能优于同等算力下继续增加数据量。因此清洗、筛选与去重是预训练阶段不可省略的一步,而不是可以推迟的优化。
四、可核对的来源
Scaling Laws for Neural Language Models,arXiv:2001.08361。
Training Compute-Optimal Large Language Models,arXiv:2203.15556。
五、适用边界
规模定律是统计趋势,外推到训练分布之外并不可靠。本文不复述任何具体预测精度数字,也不引用未经核实的公开榜单结果。