22、语言模型的训练与使用

arduino9maker

于 2025-11-08 09:18:32 发布

阅读量10

点赞数

CC 4.0 BY-SA版权

分类专栏：深度学习玩转自然语言文章标签：语言模型文本生成 LSTM

本文链接：https://blog.youkuaiyun.com/arduino9maker/article/details/155017643

深度学习玩转自然语言专栏收录该内容

33 篇文章 ¥499.90

订阅专栏¥69.90

会员秒杀 ¥9.9 重磅福利

超级会员免费看

语言模型的训练与使用

1. 准备文本数据

在开始训练语言模型之前，我们需要对文本数据进行处理。以下是具体的步骤和代码：

def save_doc(lines, filename):
    data = '\n'.join(lines)
    file = open(filename, 'w')
    file.write(data)
    file.close()

# load document
in_filename = 'republic_clean.txt'
doc = load_doc(in_filename)
print(doc[:200])

# clean document
tokens = clean_doc(doc)
print(tokens[:200])
print('Total Tokens: %d' % len(tokens))
print('Unique Tokens: %d' % len(set(tokens)))

# organize into sequences of tokens
length = 50 + 1
sequences = list()
for i in range(length, len(tokens)):
    # select sequence of tokens
    seq = tokens[i-length:i]
    # convert into a line
    line = ' '.join(seq)
    # store
    sequences.append(line)
print('Total Sequences: %d' % len(sequ