梯度消失和梯度爆炸-《动手学深度学习pytorch》

探讨深度模型中消失与爆炸问题,分析其对模型训练的影响及解决策略。深入理解梯度消失与爆炸的原因,介绍Xavier随机初始化方法,以及环境因素如协变量偏移、标签偏移和概念偏移对模型的影响。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

深度模型有关数值稳定性的典型问题是消失(vanishing)和爆炸(explosion)。

当神经网络的层数较多时,模型的数值稳定性容易变差。

多层感知机的第𝑙l层的输出𝐻(𝑙)=𝑋𝑊(1)𝑊(2)…𝑊(𝑙)H(l)=XW(1)W(2)…W(l)。此时,如果层数𝑙l较大,𝐻(𝑙)H(l)的计算可能会出现衰减或爆炸。

如权重参数为0.2和5,多层感知机的第30层输出为输入𝑋X分别与0.230≈1×10−210.230≈1×10−21(消失)和530≈9×1020530≈9×1020(爆炸)的乘积。当层数较多时,梯度的计算也容易出现消失或爆炸。

随机初始化模型参数原因:值依然相等

值相同的话,输入计算的值相同反向梯度相同,迭代后相同,本质只有一个隐藏单元在发挥作用

Xavier随机初始化

考虑环境因素

协变量偏移:输入改变了,猫变成狗。数据集不同

标签偏移:标签偏移可以简单理解为测试时出现了训练时没有的标签

概念偏移:简单术语的定义也会发生相当大的概念转变。

后果

梯度消失会导致模型训练困难,对参数的优化步长过小,收效甚微,模型收敛十分缓慢

梯度爆炸会导致模型训练困难,对参数的优化步长过大,难以收敛

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值