一、MapTask的数量由什么决定?
MapTask的数量由以下参数决定
- 文件个数
- 文件大小
- blocksize
一般而言,对于每一个输入的文件会有一个map split,每一个分片会开启一个map任务,很容易导致小文件问题(如果不进行小文件合并,极可能导致Hadoop集群资源雪崩)
hive中小文件产生的原因及解决方案见文章:
(14)Hive调优——合并小文件-优快云博客文章浏览阅读779次,点赞10次,收藏17次。Hive的小文件问题https://blog.youkuaiyun.com/SHWAIT