数据倾斜优化:sql大小表join、group等导致的

本文主要探讨Hive中的数据倾斜问题,特别是在SQL执行中的join和group操作。当某个key的记录数远超其他key时,可能导致任务卡住或超时。通过分析任务执行时间、任务Counter以及日志,可以识别数据倾斜。优化方案包括常规SQL优化、大小表join的broadcast+mapjoin、mapjoin以及针对大key的单独处理,还有调整Hive参数如增加reduce个数和优化内存设置。

Hive 优化--SQL执行顺序、Hive参数、数据倾斜 、优化

Hive 优化--SQL执行顺序、Hive参数、数据倾斜 、优化、_.-优快云博客

一、场景

如果某个key下记录数远超其他key,在join或group的时候可能会导致某个reduce任务特别慢。本文分析下join的场景。

本例子SQL如下:查询每个appid打开的次数,需要排除掉作弊的imei。

select appid,count(*)
from (
 select md5imei,appid
 from (
  select  t1.md5imei,t1.appid,t2.cheat_flags
  from  imei_open_app t1left outer joincheat_imei t2
  on t1.md5imei=t2.md5imei
 )t3
 where t3.cheat_flagsis null
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

四月天03

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值