python中文字符串转list

原创

于 2022-01-02 11:31:05 发布 · 2k 阅读

1 ·

CC 4.0 BY-SA版权

文章标签：

#python #list #keras

本文介绍了如何利用keras preprocessing的text_to_word_sequence方法将中文字符串转化为list。由于中文字符间无空格，直接转换会导致整个字符串被视为一个元素。通过在每个中文字符后加空格作为分隔符，可以正确地将字符串拆分成多个元素的list。

本文主要记录了将中文字符串转换为list的过程，其中我们使用了keras preprocessing中的text_to_word_sequence方法。这个方法是完全适配中文的。需要注意的是，中文语料一般字符之间是没有空格分割的，这与英文是不同的。如下所示，如果我们直接进行转换，由于没有空格分词，会将字符串默认为一个字符。

from tensorflow.keras.preprocessing.text import text_to_word_sequence
text = '我是人'
token = text_to_word_sequence(text)
print(token)
print(type(token

最低0.47元/天解锁文章