跳到正文

训练稳定性:学习率、初始化与归一化

14 分钟

训练曲线不下降、爆炸或剧烈抖动,往往是优化尺度问题。学习率决定每步移动,初始化决定信号起点,归一化与残差连接影响深层传播。调参前先观察梯度、激活和更新比例。

初始化

Xavier与He初始化依据扇入扇出和激活函数保持方差,避免层层放大或衰减。它们是统计近似;注意力、门控和残差分支还可能需专门缩放。

学习率范围

从对数尺度扫描,寻找损失开始下降到发散前区域。warmup可避免大模型初期更新不稳,余弦或分段衰减帮助后期收敛,但不能修复错误梯度。

归一化

BatchNorm依赖批统计,训练和推理模式不同,小批量可能不稳;LayerNorm按样本特征归一,更常用于Transformer。选择需匹配轴和任务。

梯度裁剪

裁剪可控制RNN等偶发爆炸,但阈值过低会长期缩小更新、掩盖根因。记录裁剪比例,若每步都触发,应重新检查尺度。

混合精度

半精度提高吞吐、减少显存,也更易下溢上溢。损失缩放、保留主权重和有限值检查是完整方案的一部分。

优化器状态也有尺度;Adam的二阶矩、权重衰减与梯度裁剪次序会改变更新。比较配方时记录每个细节,不把所有差异归因于学习率。

练习:比较三种学习率与两种初始化的激活、梯度、更新比和验证曲线,解释失败模式。

小纸条

梯度裁剪为什么不能作为训练爆炸的万能修复?