Hive 当前没有实现 IN/EXISTS 子查询,可以用 LEFT SEMI JOIN 重写你的子查询语句。
举个栗子:
select emp.id,emp.name from emp where emp.id in (select dept.empid from dept)
可以改写为:
select emp.id,emp.name from emp left semi join dept on (emp.id = dept.id)
1、left semi join 的限制是, JOIN 子句中右边的表只能在 ON 子句中设置过滤条件,在 WHERE 子句、SELECT 子句或其他地方过滤都不行。
2、因为 left semi join 是 in(keySet) 的关系,遇到右表重复记录,左表会跳过,而 join 则会一直遍历。这就导致右表有重复值得情况下 left semi join 只产生一条,join 会产生多条,也会导致 left semi join 的性能更高。
left semi join有去重功能