MapReduce压缩参数配置

最新推荐文章于 2025-02-09 15:43:58 发布

原创最新推荐文章于 2025-02-09 15:43:58 发布 · 695 阅读

0 ·

CC 4.0 BY-SA版权

大数据hadoop 专栏收录该内容

14 篇文章

订阅专栏

本文介绍了如何在Hadoop的MapReduce中启用压缩，包括Map输出端和Reduce输出端的压缩配置。通过设置特定参数，可以对Map任务的中间结果和Reduce的输出进行压缩，以提升性能。

MapReduce压缩参数配置

要在Hadoop中启用压缩，可以配置如下参数：

在这里插入图片描述

CompressionCodec有两个方法可以用于轻松地压缩或解压缩数据。

要想对正在被写入一个输出流的数据进行压缩，我们可以使用createOutputStream(OutputStreamout)方法创建一个CompressionOutputStream，将其以压缩格式写入底层的流。
相反，要想对从输入流读取而来的数据进行解压缩，则调用createInputStream(InputStreamin)函数，从而获得一个CompressionInputStream，从而从底层的流读取未压缩的数据。

Map输出端采用压缩

即使你的MapReduce的输入输出文件都是未压缩的文件，你仍然可以对Map任务的中间结果输出做压缩，因为它要写在硬盘并且通过网络传输到Reduce节点，对其压缩可以提高很多性能，这些工作只要设置两个属性即可。

public class WordCountDriver {

	public static void main(String[] args) throws IOException, ClassNotFoundException, InterruptedException {

//在Driver中设置
        
		// 开启map端输出压缩
	conf.setBoolean("mapreduce.map.output.compress", true);
		// 设置map端输出压缩方式
	conf.setClass("mapreduce.map.output.compress.codec", BZip2Codec.class,CompressionCodec.class);

Reduce输出端采用压缩

//在Driver类中
// 设置reduce端输出压缩开启
		FileOutputFormat.setCompressOutput(job, true);
		// 设置压缩的方式
	    FileOutputFormat.setOutputCompressorClass(job, BZip2Codec.class);
	    FileOutputFormat.setOutputCompressorClass(job, BZip2Codec.class); 
//	    FileOutputFormat.setOutputCompressorClass(job, GzipCodec.class); 
//	    FileOutputFormat.setOutputCompressorClass(job, DefaultCodec.class);

//对FileOutPUtFormat 修改