机器学习之GBDT算法（待续）

GBDT算法详解与应用

最新推荐文章于 2024-01-22 23:59:41 发布

平原2018

最新推荐文章于 2024-01-22 23:59:41 发布

阅读量1.6k

点赞数 7

CC 4.0 BY-SA版权

分类专栏：算法文章标签： GBDT

本文链接：https://blog.youkuaiyun.com/sinat_30353259/article/details/81587775

算法专栏收录该内容

42 篇文章 ¥9.90 ¥99.00

订阅专栏

超级会员免费看

GBDT（Gradient Boosting Decision Tree）是一种集成学习方法，通过结合多棵决策树以提升弱学习器性能。本文详细介绍了GBDT的概念、负梯度拟合、回归与分类算法、常用损失函数以及正则化策略。GBDT的优点包括处理不同类型数据的能力、高预测准确率和对异常值的鲁棒性，但训练过程难以并行。

一、GBDT 概念

GBDT 的全称是 Gradient Boosting Decision Tree，梯度提升决策树。

要理解 GBDT，首先就要理解这个 B(Boosting)。

Boosting 是一族可将弱学习器提升为强学习器的算法，属于集成学习（ensemble learning）的范畴。Boosting 方法基于这样一种思想：对于一个复杂任务来说，将多个专家的判断进行适当的综合所得出的判断，要比其中任何一个专家单独的判断要好。通俗地说，就是”三个臭皮匠顶个诸葛亮”的道理。

基于梯度提升算法的学习器叫做 GBM(Gradient Boosting Machine)。理论上，GBM 可以选择各种不同的学习算法作为基学习器。GBDT 实际上是 GBM 的一种情况。

为什么梯度提升方法倾向于选择决策树作为基学习器呢？(也就是 GB 为什么要和 DT 结合，形成 GBDT) 决策树可以认为是 if-then 规则的集合，易于理解，可解释性强，预测速度快。同时，决策树算法相比于其他的算法需要更少的特征工程，比如可以不用做特征标准化，可以很好的处理字段缺失的数据，也可以不用关心特征间是否相互依赖等。决策树能够自动组合多个特征。

不过，单独使用决策树算法时，有容易过拟合缺点。所幸的是，通过各种方法，抑制决策树的复杂性，降低单颗决策树的拟合能力，再通过梯度提升的方法集成多个决策树，最终能够很好的解决过拟合的问题。由此可见，梯度提升方法和决策树学习算法可以互相取长补短，是一对完美的搭档。

至于抑制单颗决策树的复杂度的方法有很多，比如限制树的最大深度、限制叶子节点的最少样本数量、限制节点分裂时的最