seq2seq中的beam search

最新推荐文章于 2025-06-23 09:42:24 发布

转载最新推荐文章于 2025-06-23 09:42:24 发布 · 2.2k 阅读

·

0

·

文章标签：

#beam search #seq2seq

Deep Learning 专栏收录该内容

97 篇文章

订阅专栏

博主因工作补充自然语言处理和语音识别知识，转载介绍了sequence2sequence模型中beam search方法。该方法仅用于测试，训练时有正确答案无需它提升准确率。以机器翻译为例，详细说明了beam size为2时，beam search在decoder过程中的工作流程。

因工作需要，最近在疯狂补充自然语言处理和语音识别的知识，内容多为转载，转的内容使我这个小白比较容易理解，大牛可以忽略。。。。

转自：https://www.sohu.com/a/159397046_206784

首先说明在sequence2sequence模型中，beam search的方法只用在测试的情况，因为在训练过程中，每一个decoder的输出是有正确答案的，也就不需要beam search去加大输出的准确率。

假设现在我们用机器翻译作为例子来说明。

我们的任务是翻译中文“我是中国人”--->英文“I am Chinese”

假设我们的词表大小只有三个单词就是I am Chinese。

那么如果我们的beam size为2的话，我们现在来解释,

如下图所示，我们在decoder的过程中，有了beam search方法后，在第一次的输出，我们选取概率最大的"I"和"am"两个单词，而不是只挑选概率最大的单词。

然后接下来我们要做的就是，把“I”单词作为下一个decoder的输入算一遍得到y2的输出概率分布，把“am”单词作为下一个decoder的输入算一遍也得到y2的输出概率分布。

比如将“I”单词作为下一个decoder的输入算一遍得到y2的输出概率分布如下：

比如将“am”单词作为下一个decoder的输入算一遍得到y2的输出概率分布如下：

那么此时我们由于我们的beam size为2，也就是我们只能保留概率最大的两个序列，此时我们可以计算所有的序列概率：

“I I” = 0.4*0.3 "I am" = 0.4*0.6

"I Chinese" = 0.4*0.1 "am I" = 0.5*0.3

"am am" = 0.5*0.3 "am Chinese" = 0.5*0.4

我们很容易得出俩个最大概率的序列为 “I am”和“am Chinese”，然后后面会不断重复这个过程，直到遇到结束符为止。

最终输出2个得分最高的序列。

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。