Lucene中文分词 “庖丁解牛”
附件 为本人设计编写的组件,中文分词“庖丁解牛”,具有相当好的使用价值。。。
高效率:我的赛扬PC 1 秒解析 >>> 20000汉字的词语 (实际测试结果数据,可达1秒10万+汉字。)
高可维护性:使用“庖丁”隐喻,形象明晰
高灵活性,可扩展:OOD
对比:《终于突破中文分词的效率问题》http://www.lucene.org.cn/read.php?tid=54&fpage=2 他的效率为 6秒 解析2588汉字
2007-08-08:
由于庖丁解牛进行了一些调整和重构,这里的附件代码已经是"较旧"的,最新的下载地址:
http://code.google.com/p/paoding/downloads/list
SVN地址为:http://paoding.googlecode.com/svn/trunk/paoding-analysis/
同时也可以通过浏览器访问http://paoding.googlecode.com/svn/trunk/paoding-analysis/ 直接浏览代码。
最新的在JavaEye的发布帖子是:
http://www.iteye.com/topic/110148 中文分词 庖丁解牛 2.0.0 发布
介绍了一种名为“庖丁解牛”的中文分词组件,该组件具有高效率(1秒可解析10万汉字以上)、高可维护性和高灵活性的特点。对比其他分词工具,其性能更为优越。
207

被折叠的 条评论
为什么被折叠?



