搜索系统中对于索引和字典的存储主要面临两大挑战:
1.数据压缩
2.快速地检索和排序
正排表的存储有如下两个点来压缩数据:
1.正排表词在在DOC中出现的为止采用单调递增差分存储,这样存储这个数字序列的时候可以用尽可能少的字节数来存,达到压缩效果
2.在存储文档中所有WORD ID的时候在最后一个词后面插入一个NULL,并且采用非结构化方式存储可以减少很多冗余的DOCID的存储
搜索系统索引存储优化
本文探讨了搜索系统中索引存储面临的挑战,包括数据压缩和快速检索排序。介绍了正排表通过单调递增差分存储和非结构化存储方式减少冗余,实现数据的有效压缩。
搜索系统中对于索引和字典的存储主要面临两大挑战:
1.数据压缩
2.快速地检索和排序
正排表的存储有如下两个点来压缩数据:
1.正排表词在在DOC中出现的为止采用单调递增差分存储,这样存储这个数字序列的时候可以用尽可能少的字节数来存,达到压缩效果
2.在存储文档中所有WORD ID的时候在最后一个词后面插入一个NULL,并且采用非结构化方式存储可以减少很多冗余的DOCID的存储
4504
3762
2900

被折叠的 条评论
为什么被折叠?