结巴分词简要理解

最新推荐文章于 2025-05-18 13:07:23 发布

原创

最新推荐文章于 2025-05-18 13:07:23 发布 · 1.3k 阅读

CC 4.0 BY-SA版权

文章标签：

本文介绍了Jieba分词的安装、主要算法，包括Trie树、动态规划和HMM模型。详细讲解了三种分词模式：精确模式、全模式和搜索引擎模式，并展示了新词识别和自定义词典的使用。此外，还探讨了关键词提取和去除停用词在文本处理中的作用。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

Python中分分词工具很多，包括盘古分词、Yaha分词、Jieba分词、清华THULAC等。它们的基本用法都大同小异，这里先了解一下结巴分词。

一、安装

pip install jieba

若使用PyCharm，从左上角的File–>Setting–>Project:工程名–>Project Interpreter，点击右侧的“+”，在弹出界面的搜索栏中输入“jieba”，Install Package

二、算法介绍结巴中文分词涉及到的算法包括：

(1) 基于Trie树结构实现高效的词图扫描，生成句子中汉字所有可能成词情况所构成的有向无环图（DAG)；

(2) 采用了动态规划查找最大概率路径, 找出基于词频的最大切分组合；

(3) 对于未登录词，采用了基于汉字成词能力的HMM模型，使用了Viterbi算法。

三、分词模式结巴中文分词支持的三种分词模式包括：

(1) 精确模式：试图将句子最精确地切开，适合文本分析；

(2) 全模式：把句子中所有的可以成词的词语都扫描出来, 速度非常快，但是不能解决歧义问题；

(3) 搜索引擎模式：在精确模式的基础上，对长词再次切分，提高召回率，适合用于搜索引擎分词。

import jieba

# 全模式
text = "我来到北京清华大学"
seg_list = jieba.cut(text, cut_all=True)
print(u"[全模式]: ", "/ ".join(seg_list))

# 精确模式
seg_list = jieba.c

200万优质内容无限畅学