这篇停更三年后的万字技术文章指出当前大模型训练数据配比存在偏差,并揭示行业遵循的幂律公式在复现过程中曾出现代码错误导致最优解失效。
前OpenAI安全研究副总裁、Thinking Machines Lab联合创始人翁荔(Lilian Weng)在个人博客Lil'Log上发布了题为《Scaling Laws, Carefully》的技术长文。该文章时隔三年多更新,旨在系统性地重新审视支撑大模型行业数百亿美元投入的缩放定律(Scaling Laws)。文章核心论点指出,现有基于该定律制定的模型训练策略存在根本性风险,尤其是数据与算力的配比可能自早期研究起便出现方向性偏差,导致行业资源未能投向最优配置路径。
文章追溯了从Kaplan提出的早期理论到DeepMind发布Chinchilla研究结论的演变过程。2020年OpenAI的研究认为模型参数量应比数据量增长更快,而2022年DeepMind通过对比Gopher与Chinchilla模型,提出参数与数据应按1:20的比例同步增长才最经济高效。翁荔在文中分析了早期理论偏差的成因,指出Kaplan实验的最大模型仅15亿参数量级,且排除了嵌入层参数计数,这种在小规模区间拟合的规律外推至万亿参数级别时产生了系统性误差。更为关键的是,文章披露了2024年Epoch AI团队在逐行复现Chinchilla代码时发现的两处严重缺陷:损失函数错误地取均值而非求和导致优化器提前停止迭代,以及核心幂律指数被四舍五入至两位数造成虚假精度,这些技术细节的修正直接动摇了当前行业广泛采用的最优配比公式的可靠性。
此外,翁荔强调了高质量文本数据即将耗尽的潜在危机,指出 Scaling Laws 默认数据无限供应的前提正在失效。这也解释了为何近期行业重心转向强化学习、测试时计算及合成数据等替代方案。文章还附带交互式模拟器,直观展示了外推预测中的微小误差如何在大模型规模下被放大。随着论文对现有技术路径的质疑,业界对于大模型训练预算分配策略及未来演进方向的讨论正进入新的阶段。