常见大模型——chatlm系列

Jacob_AI

于 2024-11-19 15:24:09 发布

阅读量1.1k

点赞数 28

文章标签：深度学习人工智能 llama

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.youkuaiyun.com/cancer_s/article/details/143433678

版权

ChatGLM

背景

主流的预训练框架主要有三种：
1、AutoRegressive自回归模型（AR模型）：代表GPT。本质上是一个Left-to-Right的语言模型。通常用于生成式任务，在长文本生成方面取得了巨大的成功。当扩展到十亿级别参数时，变现出了少样本学习能力。缺点是单向注意力机制，在NLU任务中，无法完全捕捉上下文的依赖关系。
2、Autoencoding自编码模型（AE模型）：代表BERT。是通过某个降噪目标（比如MLM）训练的双向文本编码器。编码器会产生适用于NLU任务的上下文表示，但无法直接用于文本生成。
3、Encoder-Decoder（Seq2seq模型）：代表作T5。采用双向注意力机制，常用于条件生成任务，比如文本摘要、机器翻译等。

三种预训练框架各有利弊，没有一种框架在以下三种领域表现最佳：自然语言理解（NLU）、无条件生成以及条件生成。T5曾经尝试使用MTL的方式同意上述框架，然而自编码和自回归目标天然存在差异，简单的融合自然无法继承各个框架爱的优点。

GLM预训练框架

GLM特点：

自编码思想：在输入文本中，随机删除连续的tokens。
自回归细思：顺序重建连续tokens。在使用自回归方式预测缺失tokens时，模型既可以访问corrupted文本，又可以访问之前已经被预测的spans。
span shuffing+二维位置编码技术
通过改变确实spans的数量和长度，自回

最低0.47元/天解锁文章

博客等级

码龄5年

57
原创

857
点赞

570
收藏

467
粉丝

关注

私信

热门文章

分类专栏

大模型 2篇

展开全部收起

最新评论

大模型 VS 大语言模型
Jacob_AI: 补充一下：大模型是一种基于大量数据训练的人工智能模型，具有强大的下游任务自适应能力。相对于传统的人工智能模型，大模型可以处理更多的领域和任务，其优势主要体现在以下几个方面：参数规模大：大模型拥有上亿甚至千亿级的参数，这使得它们可以处理更加复杂和抽象的任务，具有更强的泛化能力。数据依赖性：大模型的训练依赖于大量的数据，这些数据覆盖了各种场景和情况，使得大模型能够更好地理解和处理各种复杂的问题。适应性强：大模型可以适应各种不同的任务和领域，只需要通过少量的样本进行微调，就可以达到很好的效果。对于少量样本的提示，大模型具有以下优势：快速适应：大模型具有很强的泛化能力，少量样本的提示可以使其快速适应新的任务和领域。提高准确度：少量样本的提示可以减少模型的过拟合风险，提高模型的准确度。节省资源：相对于重新训练模型，少量样本的提示可以节省大量的计算资源和时间。综上所述，少量样本的提示对于大模型的回答的准确度具有很大的优势，可以提高模型的适应性和准确度，同时节省资源。
大模型 VS 大语言模型
征途黯然.: 在大模型VS大语言模型方面的专业知识令人钦佩，文章非常有价值。

大家在看

Java 后台开发中 CPU 飙高原因及解决方案深度解析

最新文章

目录

展开全部

收起

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。