机器学习算法基础知识1：决策树

monkiro

已于 2024-12-28 15:28:37 修改

阅读量1k

点赞数 23

分类专栏：机器学习算法文章标签：机器学习算法决策树

于 2024-12-28 15:04:31 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.youkuaiyun.com/qq_35702489/article/details/144776241

版权

机器学习算法基础知识1：决策树

一、本文内容与前置知识点
- 1. 本文内容
- 2. 前置知识点
二、场景描述
三、决策树的训练
三、测试集验证
四、其他知识
五、参考文献

一、本文内容与前置知识点

1. 本文内容

介绍决策树是什么，使用场景有哪些

2. 前置知识点

概率论基本知识：信息熵增益

二、场景描述

鸢尾花的类别存在Setosa，Versicolour，Virginica三种，我们希望制作一个模型，对鸢尾花进行分类。
我们会提供一些我们已经采集的样本，并且手动提取了每朵花的部分特征，数据集一共包括150个样本，每个样本包括花萼长度，花萼宽度，花瓣长度，花瓣宽度特征，以及对应鸢尾花类别的标签第5列为鸢尾花的类别（包括Setosa，Versicolour，Virginica三类）。

三、决策树的训练

我们把150个样本，取出120个作为训练集，来进行决策树的训练，目的希望决策树这个分类器有如下效果：
（1）对于训练集的样本能有比较好的分类效果
（2）对于测试集的样本能有比较好的分类效果

1. 决策树训练方式

（1）分类原则-Gini

每一层会选取一个特征进行分类，以二分类为主，分类原则遵循贪心算法，希望尽可能的把样本区分开。
使用了基尼系数作为样本分类效果的评估指标：
$Gini=1-\sum^n_{i=1}p_i^2$

最低0.47元/天解锁文章

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。