Spark Mllib里如何采用保序回归做回归分析(图文详解)

本文介绍了保序回归的基本思想及其应用场景,特别强调了在处理大规模数据集时的优势,并通过实例展示了保序回归的具体操作过程。

 

 

  不多说,直接上干货!

 

  相比于决策树,保序回归的应用范围没有决策树算法那么广泛。

  特别在数据处理较为庞大的时候,采用保序回归做回归分析,可以极大地节省资源,从而提高计算效率。

 

 

  保序回归的思想,是对数据进行均值排序,从数据集的第一个数开始,如果下一个数出现乱序,即与设定的顺序不符,则从乱序的数据开始逐个开始求得平均值,直到求得的平均值与下一个数据比较不成为乱序为止。

 

  例如一个数据集:

 {1,3,2,4,5}

 

  要求其按照保序回归由小到大进行排列。

  首先观察第一个数是1,可以不做变动继续存放。第二个是2,仍然不需要变动。第三个数是2,是属于乱序从而需要对其重新计算。

  第三个数是乱序,需要对其重新计算,提取数据2和下一个数据4,计算得到平均值为3,因此,可获得一个新的数据集:

 {1,3,3,3,5}

 

 

 

  具体,见

Spark Mllib机器学习实战的第8章 决策树与保序回归

转载于:https://www.cnblogs.com/zlslch/p/7486835.html

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值