筛选重要特征的方法feature_importance_

特征重要性分析与筛选

最新推荐文章于 2025-07-19 07:30:00 发布

原创最新推荐文章于 2025-07-19 07:30:00 发布 · 6.5k 阅读

17 ·

CC 4.0 BY-SA版权

python 专栏收录该内容

27 篇文章

订阅专栏

本文介绍了如何使用Python进行特征重要性的分析与可视化，通过sklearn库获取模型的特征重要性，利用numpy和matplotlib库进行数据排序和绘图，展示了特征重要性排名，并提供了筛选重要特征的方法。

排列表示：

importances = model.feature_importances_ 
indices = np.argsort(importances)[::-1]
feat_labels = X_train.columns
print("Feature ranking:") 
#    l1,l2,l3,l4 = [],[],[],[]
for f in range(X_train.shape[1]):
    print("%d. feature no:%d feature name:%s (%f)" % (f + 1, indices[f], feat_labels[indices[f]], importances[indices[f]]))
print (">>>>>", importances)

画图：

feature_importance = model.feature_importances_
sorted_idx = np.argsort(feature_importance)

features_list = data.columns.values
plt.figure(figsize=(5,20))
plt.barh(range(len(sorted_idx)), feature_importance[sorted_idx], align='center')
plt.yticks(range(len(sorted_idx)), features_list[sorted_idx],)
plt.xlabel('Importance')
plt.title('Feature importances')
plt.draw()
plt.show()

筛选重要程度大于某个值的特征：

#将特征名称与对应的重要性数值做成dataframe
fea = pd.DataFrame()
fea['feature_name'] = feature_name
fea['value'] = feature_importance
fea.loc[fea['value'] >0 ]

#找出重要性为0的特征
fea_0 = fea.loc[fea['value'] == 0 ]['feature_name'].tolist()
fea_0