spark ML之特征处理（1）

董可伦

已于 2022-11-18 15:06:36 修改

阅读量1.9k

点赞数 2

CC 4.0 BY-SA版权

分类专栏： ml 大数据 Spark 文章标签： spark ml

于 2018-05-18 16:29:06 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.youkuaiyun.com/dkl12/article/details/80366311

Spark 同时被 3 个专栏收录

78 篇文章 ¥49.90 ¥99.00

订阅专栏

超级会员免费看

29 篇文章

订阅专栏

3 篇文章

订阅专栏

本文详细介绍了Spark MLlib中的特征处理类，包括VectorIndexer、StringIndexer和IndexToString的使用方法和注意事项。通过实例展示了如何对分类特征进行索引、字符串标签的编号以及如何将索引转换回原始值。同时，提供了完整的代码示例，帮助读者更好地理解和应用这些工具。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

前些天发现了一个巨牛的人工智能学习网站，通俗易懂，风趣幽默，忍不住分享一下给大家。点击跳转到网站：https://www.captainai.net/dongkelun

前言

最近在学习总结机器学习常用算法，在看spark机器学习决策树的官方示例时，发现用到了几个特征处理的类，之前没学习过，所以查了一下，感觉spark在特征处理方面的类还是挺多的，所以准备总结记录一下相关的用法，首先总结一下决策树中用到的几种。

1、VectorIndexer

根据源码注释，VectorIndexer是用于在“向量”的数据集中索引分类特征列的类（Class for indexing categorical feature columns in a dataset of Vector），这看起来不太好理解，直接看用法，举例说明就好了。

1.1 数据

我们用普通的数据格式即可：
data1.txt

1,-1.0 1.0
0,0.0 3.0
1,-1.0 5.0
0,0.0 1.0

其中第一列为label,后面的为features
spark读取数据程序（供参考）：

import

了解本专栏

超级会员免费看

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

董可伦 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。