@THULAC中文词法分析工具包
THULAC中文词法分析工具包
软件简介
THULAC(THU Lexical Analyzer for Chinese)由清华大学自然语言处理与社会人文计算实验室研制推出的一套中文词法分析工具包,具有中文分词和词性标注功能。THULAC具有如下几个特点:
1.能力强。利用我们集成的目前世界上规模最大的人工分词和词性标注中文语料库(约含5800万字)训练而成,模型标注能力强大。
2.准确率高。该工具包在标准数据集Chinese Treebank(CTB5)上分词的F1值可达97.3%,词性标注的F1值可达到92.9%,与该数据集上最好方法效果相当。
3.速度较快。同时进行分词和词性标注速度为300KB/s,每秒可处理约15万字。只进行分词速度可达到1.3MB/s。
在线演示
THULAC在线演示平台thulac.thunlp.org/demo
编译和安装
- python版(兼容python2.x和python3.x)
1.源代码下载
将thulac文件放到目录下,通过 import thulac 来引用
thulac需要模型的支持,需要将下载的模型放到thulac目录下。
2.源代码下载
sudo pip install thulac
通过 import thulac 来引用
使用方式
1.分词和词性标注程序
1.1.命令格式
-python版(兼容python2.x和python3.x)
通过python程序import thulac
,新建thulac.thulac(args)
类,其中args为程序的参数。之后可以通过调用thulac.cut()
进行单句分词。
具体接口参数可查看python版接口参数
代码示例
代码示例1
import thulac
thu1 = thulac.thulac() #默认模式
text = thu1.cut("我爱北京天安门", text=True) #进行一句话分词
print(text)
代码示例2
thu1 = thulac