学习曲线learning curve和AUC值

最新推荐文章于 2024-10-17 12:09:05 发布

原创

最新推荐文章于 2024-10-17 12:09:05 发布 · 2.3k 阅读

3 ·

CC 4.0 BY-SA版权

文章标签：

#机器学习评估方法

本文探讨了过拟合的原因，包括样本问题、模型复杂度等，并介绍了学习曲线作为评估模型泛化能力的工具。学习曲线通过绘制训练集和交叉验证的准确率，展示模型在新数据上的表现，帮助判断模型是否存在过拟合。以naive Bayes和SVM为例，展示了如何绘制学习曲线，并提供了使用ShuffleSplit和SVC进行交叉验证的代码示例。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

引入

1. 什么是过拟合？

相当于泛化性差的概念，见知乎https://www.zhihu.com/question/32246256
2.可能是什么导致了过拟合？
（1）建模样本选取有误，如样本数量太少，选样方法错误，样本标签错误等，导致选取的样本数据不足以代表预定的分类规则；
（2）样本噪音干扰过大，使得机器将部分噪音认为是特征从而扰乱了预设的分类规则；
（3）假设的模型无法合理存在，或者说是假设成立的条件实际并不成立；
（4）参数太多，模型复杂度过高；
（5）对于决策树模型，如果我们对于其生长没有合理的限制，其自由生长有可能使节点只包含单纯的事件数据(event)或非事件数据(no event)，使其虽然可以完美匹配（拟合）训练数据，但是无法适应其他数据集。
（6）对于神经网络模型：a)对样本数据可能存在分类决策面不唯一，随着学习的进行,，BP算法使权值可能收敛过于复杂的决策面；b)权值学习迭代次数足够多(O