第一部分 词法
一、说明
Gensim是一种Python库,用于从文档集合中提取语义主题、建立文档相似性模型和进行向量空间建模。它提供了一系列用于处理文本数据的算法和工具,包括主题建模、相似性计算、文本分类、聚类等。在人工智能和自然语言处理领域,Gensim是一个流行的工具,用于处理大量的文本和语料库。
该模块使用高度优化的 C 例程、数据流和 Pythonic 接口来实现 word2vec 系列算法。
word2vec 算法包括skip-gram 和 CBOW 模型,使用分层 softmax 或负采样:Tomas Mikolov 等人:Efficient Estimation of Word Representations in Vector Space,Tomas Mikolov 等人:Distributed Representations of Words and Phrases and their Compositionality。
二、其他嵌入
在 Gensim 中训练词向量的方法有很多,而不仅仅是 Word2Vec。另请参见