spark性能调优(一):Shuffle

我爱夜来香A

已于 2023-02-27 20:46:17 修改

阅读量492

点赞数

分类专栏： Spark 文章标签： spark 大数据分布式

于 2023-02-27 20:40:15 首次发布

本文链接：https://blog.youkuaiyun.com/nzbing/article/details/129249387

版权

Spark 专栏收录该内容

26 篇文章 ¥19.90 ¥99.00

订阅专栏

超级会员免费看

本文详细介绍了Spark中的Shuffle过程，包括为何需要Shuffle、配置项调优、如何减少Shuffle数据量以及避免Shuffle的方法。在配置项调优中，提到了调整Map和Reduce阶段的缓冲区大小以及使用sort shuffle的优化。减少Shuffle数据量的策略包括使用部分聚合函数和序列化存储。最后，提出了数据预分布、Broadcast Join和选择合适的算子来避免不必要的Shuffle。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

Shuffle

何为shuffle?

集群中跨进程、跨节点的数据分发(Map的输出文件写到本地磁盘,Reducer把Map的输出文件拉到本地)

为什么要shuffle?

准确的说,shuffle是刚需(业务场景决定的),分布式环境中,不同节点不能进行内存交换,只能先落到磁盘,然后通过网络分发

一、配置项调优

在这里插入图片描述
1、Shuffle Map阶段,计算结果会以中间文件形式写入到磁盘文件系统,为了避免频繁的IO操作,spark会把中间文件写入的缓冲区,就是上述Map端的参数,可以扩大spark.shuffle.file.buffer,缓冲区越大,spark需要刷盘次数越少
2、同样地,Shuffle reduce阶段,spark会通过网络分发从不同节点中拉取中间文件,读缓冲区越大,拉取数据的网络请求就越少,可以通过设置spark.reducer.maxSizeInFight来控制Reduce端缓冲区大小
3、Spark 1.6后,spark基本不用spark shuffle,开始使用sort shuffle,这在map和reduce阶段都会产生排序,但对于一些不需要排序的场景,可以设置spark.shuffle.byPassMergeThreshold Map阶段不进行排序的分区阈值,只要reducer数量小于这个值,就可以不排序,避免额外的排序开销</