21、梯度下降策略解析

tree

于 2025-09-24 10:12:50 发布

阅读量10

点赞数

CC 4.0 BY-SA版权

分类专栏：深度学习的智慧之源文章标签： RMSProp Adam AdaDelta

本文链接：https://blog.youkuaiyun.com/tree/article/details/154629902

深度学习的智慧之源专栏收录该内容

68 篇文章 ¥499.90

订阅专栏¥69.90

会员秒杀 ¥9.9 重磅福利

超级会员免费看

梯度下降策略解析

1. RMSProp算法

RMSProp算法在估计 $A_i$ 时，采用指数平均而非简单地累加平方梯度。其基本思想是使用衰减因子 $\rho \in(0, 1)$，对 $t$ 次更新前的平方偏导数赋予权重 $\rho^t$。具体更新 $A_i$ 的方式如下：
[A_i \Leftarrow \rho A_i + (1 - \rho) \left(\frac{\partial L}{\partial w_i}\right)^2, \forall i]
每个参数的该值的平方根用于归一化其梯度，然后使用以下公式更新全局学习率 $\alpha$：
[w_i \Leftarrow w_i - \frac{\alpha}{\sqrt{A_i}} \frac{\partial L}{\partial w_i}, \forall i]
为避免病态条件，分母中可使用 $\sqrt{A_i} + \epsilon$ 代替 $\sqrt{A_i}$，其中 $\epsilon$ 是一个小的正值，如 $10^{-8}$。RMSProp 相较于 AdaGrad 的优势在于，陈旧梯度的重要性会随时间呈指数衰减，并且可在计算算法中融入动量概念。不过，其缺点是二阶矩的运行估计 $A_i$ 在早期迭代中存在偏差，因为它初始化为 0。