这里举个例子。比如我们有几百个文件,会有几百个 map 出现,读取之后进行 join 操作,会比较慢。这个时候我们可以进行 coalesce 操作,比如 240个 map,我们合成 60 个map,也就是 窄依赖 (不走shuffle)。这样再shuffle,过程产生的文件数会大大减少。提高 join 的时间性能。
调优之前与调优之后性能的详细对比(例如调整 map 个数,map 个数之前多少、之后多少,有什么提升)
于 2022-05-27 16:47:27 首次发布
这里举个例子。比如我们有几百个文件,会有几百个 map 出现,读取之后进行 join 操作,会比较慢。这个时候我们可以进行 coalesce 操作,比如 240个 map,我们合成 60 个map,也就是 窄依赖 (不走shuffle)。这样再shuffle,过程产生的文件数会大大减少。提高 join 的时间性能。