数据竞赛房租预测——整理

以下将从本次学习的六个环节进行总结:

  • 赛题分析

此部分学习了EDA描述性统计分析。学习并掌握了缺失值分析、单调特征列分析。

数据分析的初步流程:查看标签info——>具体分析标签特征(单调性、出现频次、缺失率、分布情况)——>

分析训练集时别忘了兼顾测试集

 

  • 数据清洗

查看数据缺失情况后对造成的原因进行分析及处理;异常值同理。根据主观遴选,对部分标签进行深度清洗。

此环节亦属于EDA分析。

  • 特征选择

对数据进行合理分析后(计算统计特征),对部分标签进行特征合并。

方法包括:groupby、聚类方法、相关系数法、log平滑、wrapper、Embedded基于惩罚项的特征选择、

随机森林:平均不纯度减少

  • 模型选择

  • 模型融合

 此两部分还未与前文知识有较好融合。后续会跟进学习。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值