训练稳定性:学习率、初始化与归一化
约 14 分钟
训练曲线不下降、爆炸或剧烈抖动,往往是优化尺度问题。学习率决定每步移动,初始化决定信号起点,归一化与残差连接影响深层传播。调参前先观察梯度、激活和更新比例。
初始化
Xavier与He初始化依据扇入扇出和激活函数保持方差,避免层层放大或衰减。它们是统计近似;注意力、门控和残差分支还可能需专门缩放。
学习率范围
从对数尺度扫描,寻找损失开始下降到发散前区域。warmup可避免大模型初期更新不稳,余弦或分段衰减帮助后期收敛,但不能修复错误梯度。
归一化
BatchNorm依赖批统计,训练和推理模式不同,小批量可能不稳;LayerNorm按样本特征归一,更常用于Transformer。选择需匹配轴和任务。
梯度裁剪
裁剪可控制RNN等偶发爆炸,但阈值过低会长期缩小更新、掩盖根因。记录裁剪比例,若每步都触发,应重新检查尺度。
混合精度
半精度提高吞吐、减少显存,也更易下溢上溢。损失缩放、保留主权重和有限值检查是完整方案的一部分。
优化器状态也有尺度;Adam的二阶矩、权重衰减与梯度裁剪次序会改变更新。比较配方时记录每个细节,不把所有差异归因于学习率。
练习:比较三种学习率与两种初始化的激活、梯度、更新比和验证曲线,解释失败模式。
小纸条
梯度裁剪为什么不能作为训练爆炸的万能修复?