本课程围绕中国人民大学高瓴人工智能学院赵鑫教授团队出品的《大语言模型》书籍展开,覆盖大语言模型训练与使用的全流程,从预训练到微调与对齐,从使用技术到评测应用,帮助学员全面掌握大语言模型的核心技术。并且,课程内容基于大量的代码实战与讲解,通过实际项目与案例,学员能将理论知识应用于真实场景,提升解决实际问题的能力。
课程地址:https://www.datawhale.cn/learn/summary/107
赵鑫教授团队:http://aibox.ruc.edu.cn/
视频课程地址:《大语言模型》2.3 长上下文模型和新型架构_哔哩哔哩_bilibili

长上下文模型是指能够处理和理解长序列文本的神经网络模型。由于传统的循环神经网络(RNN)和长短时记忆网络(LSTM)等模型在处理长序列时存在梯度消失和内存限制等问题,研究人员开发了多种新型架构来克服这些挑战。以下是一些新型长上下文模型的架构:
1. Transformer模型
大语言模型长上下文新型架构介绍

最低0.47元/天 解锁文章

被折叠的 条评论
为什么被折叠?



