CoreNLP是由斯坦福大学开源的一套Java NLP工具,提供诸如:词性标注(part-of-speech (POS) tagger)、命名实体识别(named entity recognizer (NER))、情感分析(sentiment analysis)等功能。
1. 前言
\[P_w(y|x) = \frac{exp \left( \sum_i w_i f_i(x,y) \right)}{Z_w(x)} \]
其中,\(Z_w(x)\)为归一化因子,\(w\)为模型的参数,\(f_i(x,y)\)为特征函数。
2. 分解
以下源码分析基于3.7.0版本,分词示例见SegDemo类。
模型
主要模型文件有两份,一份为词典文件dict-chris6.ser.gz:
本文探讨了Stanford CoreNLP的中文分词功能,它基于CRF模型,利用词典和特征函数进行分词。特征包括C、CpC、CnC三类,但速度较慢,效果一般。在PKU、MSR测试集上表现有待提升。
订阅专栏 解锁全文
395

被折叠的 条评论
为什么被折叠?



