ES 分析器

本文介绍了Elasticsearch中分析器的工作原理,包括Characterfilters、Tokenizer及Tokenfilters三个主要组件的作用。通过示例展示了如何使用标准分析器对文本进行分词处理。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

  • 分析器是三种功能的封装
    1. Character filters
      字符会首先被依次送到各种character filters,它们会在tokenization之前整理string,比如去掉html标记、把&转换为and等。
    2. Tokenizer
      使用分词器把字符串分割为单独的词
    3. Token filters
      被分词器分割出来的词会依次送到过滤器,过滤器可能会对词语进行修改(比如大写转换为小写),移除(例如a、and、the),添加(添加同义词)
  • 测试分析器
GET /_analyze?analyzer=standard
Text to analyze

结果

{
   "tokens": [
      {
         "token":        "text",
         "start_offset": 0,
         "end_offset":   4,
         "type":         "<ALPHANUM>",
         "position":     1
      },
      {
         "token":        "to",
         "start_offset": 5,
         "end_offset":   7,
         "type":         "<ALPHANUM>",
         "position":     2
      },
      {
         "token":        "analyze",
         "start_offset": 8,
         "end_offset":   15,
         "type":         "<ALPHANUM>",
         "position":     3
      }
   ]
}
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值