adam通过为每个参数独立维护二阶矩估计v_t实现自适应学习率,自动缩放步长为η/√(v_t+ε),使小梯度参数获“放大镜”、大梯度参数受“刹车”,同时一阶矩估计m_t经偏差校正更准反映梯度趋势,加速穿越平坦区并减少震荡。

Adam的自适应学习率如何避免SGD的“步长僵化”
SGD所有参数共用一个lr,而实际训练中不同层、不同参数的梯度幅值差异极大——比如Embedding层梯度稀疏且小,CNN最后一层梯度剧烈波动。固定步长必然导致部分参数更新过慢或震荡。Adam为每个参数单独维护v_t(二阶矩估计),自动缩放步长:lr / sqrt(v_t + epsilon)。这相当于给小梯度参数“放大镜”,给大梯度参数“刹车”,初期下降路径更平滑。
一阶动量(m_t)让Adam比SGD少走“回头路”
SGD+Momentum虽也有动量项,但它的v_t只是历史梯度的指数加权平均;Adam的m_t是带偏差校正的一阶矩估计,能更准确反映当前梯度趋势。尤其在非凸损失曲面中,当某维度梯度连续几轮方向一致时,m_t快速累积,推动参数加速穿越平坦区域;而SGD即使设momentum=0.9,仍易在鞍点附近因梯度为零而停滞。实测ResNet-18在CIFAR-10上,Adam第5轮验证准确率就超68%,SGD+Momentum同期仅59%。
为什么Adam收敛快,但后期容易卡在尖锐极小值?
这是自适应机制的双刃剑:
- v_t对梯度平方做平滑估计,天然抑制高频噪声 → 损失曲线下降更稳,但丢失了SGD靠小批量采样引入的有益扰动
- 偏差校正(m_hat, v_hat)缓解冷启动偏差,却也让早期更新过于“自信”,快速锁死某些参数
- 结果就是Adam常收敛到sharp minimum(曲率大、泛化差),而SGD的震荡反而帮它找到flat minimum(曲率小、鲁棒性强)
这点在ImageNet微调任务中特别明显:Adam 30轮达76.2% top-1,但SGD从第45轮开始反超,最终高0.8个百分点。
PyTorch里AdamW比Adam更适合现代模型
原始Adam的weight_decay和L2正则耦合在梯度更新里,会导致大权重参数衰减被自适应学习率压缩。而AdamW把权重衰减解耦成独立操作:param = param * (1 - weight_decay * lr)。这对Transformer类模型尤其关键——其Attention权重对正则敏感,用Adam常出现早衰。实践中,AdamW(lr=3e-4, weight_decay=0.01)在BERT微调中比Adam稳定30%以上,且最终F1高0.4。
真正难的是平衡:收敛速度是表象,泛化能力才是终点。Adam快,但快完之后要不要切回SGD做最后几轮精调,得看验证集loss是否还在缓慢下降——这个拐点,往往藏在第80%训练轮次之后。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











