前言
词语的相似性的计算方法有很多,比如字面相似度计算方法、基于语义词典的计算方法、基于统计的相似度(向量空间模型)计算方法和基于神经网络的相似度计算方法。
本篇文章讲讲基于词林的语义相似性。
词林
《同义词词林》是上世纪80年代出版的对汉语词汇进行语义分类的义类词典,共收录64223条词目。随后发展,哈尔滨工业大学信息检索实验室对其进行修正完善,《哈工大社会计算与信息检索研究中心同义词词林扩展版》。
格式
举个例子一般的格式如下,一共包含了五个级别和一个标记位,看下面第一行从左到右,A为一级、a为二级、01为三级、A为四级、02为五级、=为标记位。标记位主要是用于区分常规同义词、相关词和只有词语本身,分别用=
#
@
三个符号表示。其中 = 表示常规同义词,# 表示相关词,@ 则表示独立性质,既没有同义词也没有相关词。
Aa01A02= 人类 生人 全人类
Aa01B03# 良民 顺民
Aa01D01@ 角色
Aa02A08= 奴 妾 妾身 民女
编码位 | 1 | 2 |
---|