AI2026年10月4日· 约 3 分钟
大语言模型的 Scaling:扩展方向、收益规律与训练配置
#模型扩展#训练配置#语言模型#预训练
大语言模型的 Scaling:扩展方向、收益规律与训练配置
大语言模型的 Scaling:扩展方向、收益规律与训练配置
Scaling laws 的核心价值,是估计扩大模型与训练量的收益,并在计算预算内找到更好的配比。 它把“投入更多资源通常能降低损失”的经验,变成可以测量、拟合和检验的关系。这里的主要质量指标是语言建模交叉熵;具体任务是否改善,还要单独评估。
本文重点回答:新增参数应放在深度、主干宽度还是前馈网络(FFN)?模型规模与训练 token 怎样配比?上下文长度、batch 和学习率又怎样校准?讨论以稠密、自回归 Transformer 的预训练为主,从 Kaplan 与 Chinchilla 出发,结合架构实验说明哪些选择已有依据,哪些仍需试验。
全文的中心判断:模型容量、单次输入的信息范围、累计训练量是三个不同的扩展方向。先分清扩大了什么,再比较收益与成本,才能科学配置训练。
下面列出全文最重要的判断,后续各节解释依据与适用条件。
| 核心问题 | 可以带走的判断 | 依据的位置 |
|---|---|---|
| 规模增加有什么规律? | 纯幂律范围内,相同倍率的规模增长对应相同的相对损失下降;这不保证无限外推 | 第一节 |
| 参数如何扩大? | 标准结构且模块比例固定时,主干参数随层数近似线性增长,随主干宽度近似平方增长 | 第二节 |
| 应优先加深还是加宽? | Kaplan 的合理配置中,多种配比损失接近;后续实验发现排名可随规模改变,本文讨论的研究未确立统一最优比例 | 第三节 |
| 延长上下文扩大了什么? | 主要扩大单次预测的可见信息范围,同时增加激活与计算;通常不增加主干参数 | 第四节 |
| 模型与训练量如何配比? | Chinchilla 支持随预算近似同步扩大二者;约 20 token/参数是初始参考,最终配比要校准 | 第五、六节 |
| 考虑部署后怎样选? | 推理需求大时,达到同等质量的较小、训练更久的模型可能降低总成本 | 第七节 |
正文用“实验发现”“理论推导”“配置实例”和“本文建议”区分信息性质。实测结果说明测试条件下发生了什么;理论结论依赖模型假设;成功配置展示可行路径;配置建议则需要项目实验检验。
一、幂律如何描述规模收益#
1. 模型规模、训练量和计算量怎样联系#
参数量决定模型规模,累计 token 决定训练量,FLOPs 衡量二者共同产生的计算开销。 先约定三个核心量:\(N\) 表示模型参数量,\(D\) 表示训练累计处理的有效 token 数,\(C\) 表示训练计算量,以浮点运算次数(FLOPs)计量。这里的有效 token 不包括填充位置;数据重复出现时,每次实际参与训练都会计入累计处理量。模型效果先用固定验证集上的平均交叉熵损失 \(\ell\) 衡量,后续再检查具体任务的表现。
权重矩阵计算占主导时,训练成本近似与“参数量 × 累计 token”成正比。 常见稠密 Transformer 的初步估算为:
\[C \approx 6ND.
\]
评论