Python/scikit-learn机器学习库(特征选取)

最新推荐文章于 2025-10-11 11:56:38 发布

原创

最新推荐文章于 2025-10-11 11:56:38 发布 · 1.8w 阅读

15 ·

CC 4.0 BY-SA版权

文章标签：

#机器学习

本文介绍了Python scikit-learn库中进行特征选择的各种方法，包括基于方差阈值去除低变异性特征，单变量特征选取如SelectKBest、SelectPercentile，循环特征选取如RFE、RFECV以及L1正则化的线性SVC。此外，还探讨了决策树的特征重要性和sklearn.datasets中的分类数据生成。

去除方差小的特征

设置一个方差阈值，没有达到这个方差阈值的特征都会被丢弃。
VarianceThreshold，算法输入只要求特征(X),不需要输入结果(Y)。

from sklearn.feature_selection import VarianceThreshold
X=[[feature1,feature2,…],…]
sel=VarianceThreshold(threshold=xx)
print(sel.fit_transform(X))

单变量特征选取

单变量特征提取的原理是分别计算每个特征的某个统计指标，根据该指标来选取特征。
SelectKBest、SelectPercentile，前者选择排名前k个的特征，后者选择排名在前k%的特征。选择的统计指标需要指定，对于regression问题，使用f_regression指标;对于classification问题，可以使用chi2或者f_classif指标。