《自然语言处理实战入门》深度学习 ---- 预训练模型初探

shiter

已于 2022-12-17 23:19:23 修改

阅读量1k

点赞数

CC 4.0 BY-SA版权

分类专栏：自然语言处理实战入门【Generative AI重制版】文章标签：预训练 NLP 自然语言处理

于 2020-12-01 08:54:26 首次发布

本文链接：https://blog.youkuaiyun.com/wangyaninglm/article/details/110359248

自然语言处理实战入门【Generative AI重制版】专栏收录该内容

169 篇文章 ¥29.90 ¥99.00

订阅专栏

超级会员免费看

文章大纲

前言
预训练模型简介
主流预训练模型
预训练模型与分类
将 PTMs 应用至下游任务
- 微调策略
未来研究方向
参考文献

前言

随着深度学习的发展，各种神经网络被广泛用于解决自然语言处理(NLP)任务，如卷积神经网络(convolutional neural networks, CNNs)、递归神经网络(neural networks, RNNs)、基于图的神经网络(graphbased neural network, GNNs)和注意力机制等。这些神经模型的优点之一是能够缓解特征工程问题。非神经NLP方法通常严重依赖于离散的手工特征，而神经方法通常使用低维和稠密的向量(又称分布式表示)隐式地表示语言的语法或语义特征。这些表示是在特定的NLP任务中学习的。因此，神经方法使人们可以很容易地开发各种NLP系统。

尽管神经模型在NLP任务中取得了成功，但与计算机视觉(CV)领域相比，性能改进可能不那么显著。主要原因是，当前用于大多数监督的NLP任务的数据集相当小(机器翻译除外)。深度神经网络通常具有大量的参数，使其对这些小的训练数据过度拟合，在实际应用中泛化效果不佳。因此，许多NLP任务的早期神经模型相对较浅，通常只包含1 ~ 3个神经层。

最近大量的工作表明，在大型语料库上的预训练模型(PTMs)可以学习通用语言表示，这对后续的NLP任务是有益的，可以避免从零开始训练新模型。随着计算能力的发展，深层模型(即随着训练技能的不断提高，PTMs的体系结构由浅向深推进。第一代PTM的目标是学习好的词嵌入。由于下游任务不再需要这些模型本身，它们在计算效率方面通常非常肤浅，如Skip-Gram和GloVe。虽然这些预训练的嵌入可以捕获单词的语义含义，但它们是上下文无关的，不能捕获文本的高级概念，如语法结构、语义角色、回指等。第二代PTMs主要学习上下文词嵌入，如CoVe、ELMo、Open