连续数据离散化–5箱等宽离散法
今天又接触到一个新的概念—5箱等宽离散法。
在很多领域,都是基于离散的数据进行展开的,比如朴素贝叶斯算法。如果想利用这些方法,就必须将数据进行离散化。
离散化(分箱)常用的方法包括:等宽法、等频法以及聚类法。
等宽法就是使箱子的宽度相同,比如这篇博客里举的例子:
https://blog.youkuaiyun.com/abciscool/article/details/104984747
等频法就是让每个箱子的样本数量相等。假如一共有100个样本,要分成5个箱子,那个每个箱子的样本数量都是20。
聚类法首先将连续的数据利用聚类算法划分成簇,每个簇中的数据是一个箱子。
(侵权即删)