5.2 缺失值处理

去除缺失值

        数据缺失分为两种:一种是行记录的缺失,这种情况又称数据记录丢失;另一种是数据列值的缺失,即由于各种原因导致的数据记录中某些列的值空缺。

        去除缺失值数据通常分为两种情况:一种是删除存在遗漏信息属性值的对象的列,另一种是删除存在遗漏信息属性值对象的记录,从而得到一个完备的信息表。缺失值数据在缺失值所在的列对最终分析结果无重要意义或存在缺失值的记录与初始数据集的数据量相比非常小的情况下非常有效。

案例介绍:通过Kettle工具,去除原始数据集revenue.txt中的缺失值。

现在有一份就业人员的收入数据文件revenue.txt,由于某种原因,在数据采集的过程中产生了大量的缺失值数据,内容如图所示

打开kettle,创建转换并添加“文本文件输入”控件、“字段选择”控件、“过滤记录”控件、“Excel输出”控件、“空操作(什么也不做)”控件以及Hop跳连接线。

 

 单击【浏览】按钮,选择要去除缺失值的文件revenue.txt;单击【增加】按钮,将要去除缺失值的文件revenue.txt添加到“文本文件输入”控件中。

单击“字段”选项卡;根据文件revenue.txt的内容添加对应的字段名称,并指定数据类型。 

配置“字段选择”控件

 

双击“过滤记录”控件,进入“过滤记录”界面, 过滤记录的配置如下图所示

运行转换

查看“Excel输出”控件输出的文件file.xls是否还含有缺失值数

已经没有缺失值

NamePayArea
garcia5,000.00California
anderso6,000.00California
sharma4,000.00New Jersey
smith8,000.00New York
johnson9,000.00New York
garcia10,000.00New York
anderso12,000.00California
jones3,000.00New York
johnson5,500.00New York
jones6,000.00California
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

清水*

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值