Solr（3.中文分词器）

最新推荐文章于 2018-05-16 14:59:54 发布

xsf18

最新推荐文章于 2018-05-16 14:59:54 发布

阅读量320

点赞数

分类专栏：软件安装配置问题

软件安装配置问题专栏收录该内容

8 篇文章

订阅专栏

本文介绍如何使用IK分词器增强Solr的中文处理能力，包括配置方法及注意事项。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

lucence有很多优秀的分词器，但是由于lucene是外国人开发的，所以分词器相应的也是对英文更加友好，虽然随着lucence版本的跟进，中文分词有一定的优化，可还是很难做到中国人的习惯。
IK分词器就是一款中国人开发的，扩展性很好的中文分词器，它支持扩展词库，可以自己定制分词项，这对中文分词无疑是友好的。
但是IK分词器从2012年就停止更新了，为了支持最新版的solr，对IK的源码进行了稍许的修改

点击下载，秘钥：fvf0。

下载好之后，将IK对应的jar复制到项目的WEB-INF/lib下面，然后在WEB-INF下面创建一个classes的目录，将其余三个文件（IKAnalyzer.cfg.xml , ext.dic和stopword.dic）复制到这个classes目录下。
打开solr_home/core_1/conf/manage_schema，添加：

     
     
      
      <!-- 我添加的IK分词 -->
     
     
     
     
      
      <fieldType name="text_ik" class="solr.TextField">
     
     
     
     
      
          <analyzer type="index" isMaxWordLength="false" class="org.wltea.analyzer.lucene.IKAnalyzer"/>
     
     
     
     
      
          <analyzer type="query" isMaxWordLength="true" class="org.wltea.analyzer.lucene.IKAnalyzer"/>
     
     
     
     
      
      </fieldType>

同时，把需要分词的字段，设置为text_ik

     
     
      
      <field name="id" type="int" indexed="true" stored="true" required="true" multiValued="false" />
     
     
     
     
      
      <field name="name" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" />
     
     
     
     
      
      <field name="title" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" />
     
     
     
     
      
      <field name="category" type="int" indexed="true" stored="true" required="true" multiValued="false" />
     
     
     
     
      
      <field name="content" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" />
     
     
     
     
      
      <field name="updatetime" type="date" indexed="true" stored="true" required="true" multiValued="false" />

重启服务，让配置生效。注意：如果之前已经创建了索引，需要将之前的索引删掉，重新创建分词后的索引。
测试一下，选择刚刚添加text_ik

另外，解释一下IK的配置，其中IKAnalyzer.cfg.xml为配置文件，主要用来配置扩展词库，禁止词词库等

     
     
      
      <?xml version="1.0" encoding="UTF-8"?>
     
     
     
     
      
      <!DOCTYPE properties SYSTEM "http://java.sun.com/dtd/properties.dtd">
     
     
     
     
      
      <properties>
     
     
     
     
      
          <comment>IK Analyzer 扩展配置</comment>
     
     
     
     
      
          <!--用户可以在这里配置自己的扩展字典 -->
     
     
     
     
      
          <entry key="ext_dict">ext.dic;</entry>
     
     
     
     
      
          <!--用户可以在这里配置自己的扩展停止词字典-->
     
     
     
     
      
          <entry key="ext_stopwords">stopword.dic;</entry>
     
     
     
     
      
      </properties>

stopword.dic和ext.dic分别为禁止词词库和扩展词库，注意，词库的的编码方式为UTF-8 无BOM的编码方式，添加新词的时候，需要注意。