Hadoop【理论篇】09：InputFormat以及OutputFormat分析

做一个有趣的人Zz

已于 2025-06-10 09:01:01 修改

阅读量928

点赞数 1

分类专栏：大数据工程师的成长之路 Hadoop 文章标签： hdfs hadoop mr

于 2022-03-02 15:51:08 首次发布

本文链接：https://blog.youkuaiyun.com/weixin_40612128/article/details/123232395

版权

大数据工程师的成长之路同时被 2 个专栏收录

136 篇文章 ¥69.90 ¥99.00

订阅专栏

Hadoop

28 篇文章

订阅专栏

本文深入分析了Hadoop中的InputFormat和OutputFormat。InputFormat的getSplits方法用于逻辑切分输入文件，影响Map任务数量。一个1G文件默认产生8个map任务，而1000个100KB文件会产生1000个任务。140M文件由于小于1.1个Block，产生1个map任务，而141M文件产生2个。通过WordCount测试验证了理论。OutputFormat则控制MapReduce的输出，包括getRecordWriter、checkOutputSpecs和getOutputCommitter等方法。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

一、InputFormat

Hadoop中有一个抽象类是InputFormat，InputFormat抽象类是MapReduce输入数据的顶层基类，这个抽象类中只定义了两个方法

一个是getSplits方法
另一个是createRecordReader方法

这个抽象类下面有三个子继承类

DBInputFormat是操作数据库的，
FileInputFormat是操作文件类型数据的，
DelegatingInputFormat是用在处理多个输入时使用的

这里面比较常见的也就是FileInputFormat了，FileInputFormat是所有以文件作为数据源的基类，FileInputFormat保存job输入的所有文件，并实现了对输入文件计算splits的方法，至于获得文件中数据的方法是由子类实现的。
FileInputFormat下面还有一些子类：

CombineFileInputFormat：处理小文件问题的，后面我们再详细分析
TextInputFormat：是默认的处理类，处理普通文本文件，他会把文件中每一行作为一个记录，将每一行的起始偏移量作为key，每一行的内容作为value，这里的key和value就是我们之前所说的k1,v1
它默认以换行符或回车键作为一行记录
NLine

了解本专栏