kaggle Santander Customer Transaction Prediction总结

本文总结了作者在kaggle Santander Customer Transaction Prediction竞赛中的经历,包括数据特点:样本不均衡、特征间相关性小、特征分布相似。在特征工程方面,尝试了数据洗牌、value_count、排序和相似比率统计。顶尖选手的策略包括count特征、特征堆叠以及标准化。此外,还提到了神经网络训练技巧和LightGBM的节点分裂图分析。尽管未取得理想成绩,但作者认识到深入理解基础操作和不断尝试的重要性,特别是神经网络的应用。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

记一次失败的竞赛经历

数据分析

1.样本不均衡。在20万训练数据集中,正样本(y=1)为2万,负样本(y=0)为18万。

2.所有原始特征之间相关性很小。这一点很奇怪,很少有数据集所有特征之间相关性都很小的。

3.所有特征的分布都类似。这一点也是挺奇怪,应该是主办方对数据做了某种变换。

特征工程

1.由于这个赛题所有特征均为匿名特征且特征之间没有什么关联,所以可以考虑对数据进行重新洗牌(shuffle)。对于训练数据,分别在标签为0和标签为1的样本中进行重新洗牌。即对于每个特征都进行shuffle操作,这样得到完全不同的样本,分别用这些不同的样本去训练,然后做预测,最后取平均得到最后的结果。

2.value_count特征。去除test中的合成数据后求各个特征中唯一值的个数。

3.排序特征。对数值特征进行排序。

4.相似比率特征之间的统计特征。这里的比率为对某个特定值,求target为1的概率。然后对所有特征做相似性分析,把相似性高的特征划为一组。如下:

然后对每组相似特征求统计特征。

TOP选手方案:

特征部分࿱

1、资源项目源码均已通过严格测试验证,保证能够正常运行; 2、项目问题、技术讨论,可以给博主私信或留言,博主看到后会第一时间与您进行沟通; 3、本项目比较适合计算机领域相关的毕业设计课题、课程作业等使用,尤其对于人工智能、计算机科学与技术等相关专业,更为适合; 4、下载使用后,可先查看README.md文件(如有),本项目仅用作交流学习参考,请切勿用于商业用途。1、资源项目源码均已通过严格测试验证,保证能够正常运行; 2、项目问题、技术讨论,可以给博主私信或留言,博主看到后会第一时间与您进行沟通; 3、本项目比较适合计算机领域相关的毕业设计课题、课程作业等使用,尤其对于人工智能、计算机科学与技术等相关专业,更为适合; 4、下载使用后,可先查看README.md文件(如有),本项目仅用作交流学习参考,请切勿用于商业用途。1、资源项目源码均已通过严格测试验证,保证能够正常运行; 2、项目问题、技术讨论,可以给博主私信或留言,博主看到后会第一时间与您进行沟通; 3、本项目比较适合计算机领域相关的毕业设计课题、课程作业等使用,尤其对于人工智能、计算机科学与技术等相关专业,更为适合; 4、下载使用后,可先查看README.md文件(如有),本项目仅用作交流学习参考,请切勿用于商业用途。1、资源项目源码均已通过严格测试验证,保证能够正常运行; 2、项目问题、技术讨论,可以给博主私信或留言,博主看到后会第一时间与您进行沟通; 3、本项目比较适合计算机领域相关的毕业设计课题、课程作业等使用,尤其对于人工智能、计算机科学与技术等相关专业,更为适合; 4、下载使用后,可先查看README.md文件(如有),本项目仅用作交流学习参考,请切勿用于商业用途。1、资源项目源码均已通过严格测试验证,保证能够正常运行; 2、项目问题、技术讨论,可以给博主私信或留言,博主看到后会第一时间与您进行沟通; 3、本项目比较适合计算机领域相关的毕业设计课题、课程作业等使用,尤其对于人工智能、计算机科学与技术等相关专业,更为适合; 4、下载使用后,可先查看README.md文件(如有),本项目仅用作交流学习参考,请切勿用于商业用途。1、资源项目源码均已通过严格测试验证,保证能够正常运行; 2、项目问题、技术讨论,可以给博主私信或留言,博主看到后会第一时间与您进行沟通; 3、本项目比较适合计算机领域相关的毕业设计课题、课程作业等使用,尤其对于人工智能、计算机科学与技术等相关专业,更为适合; 4、下载使用后,可先查看README.md文件(如有),本项目仅用作交流学习参考,请切勿用于商业用途。1、资源项目源码均已通过严格测试验证,保证能够正常运行; 2、项目问题、技术讨论,可以给博主私信或留言,博主看到后会第一时间与您进行沟通; 3、本项目比较适合计算机领域相关的毕业设计课题、课程作业等使用,尤其对于人工智能、计算机科学与技术等相关专业,更为适合; 4、下载使用后,可先查看README.md文件(如有),本项目仅用作交流学习参考,请切勿用于商业用途。
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值