hive支持sql join 语句但是只支持等值连接,并且还不支持在on字句中的谓词间使用or
有左外连接右外连接内连接全连接笛卡尔积
比较特殊的还有left semi-join(左半开连接)
左半开连接可以返回左边表的记录 前提是右边表满足on语句的判定条件
https://www.cnblogs.com/wqbin/p/11023008.html
这里还有需要注意的一个点
map-side join
如果所有表里面只有一个是小表,那么可以在最大的表通过mapper的时候将小表完全放入内存中,hive可以在map短执行连接过程,因为hive可以在内存中的小标逐一匹配,从而忽略常规操作的reduce过程。
join优化:
hive假定查询中最后一个表是最大的表 因为在对每行记录连接操作时候,它会尝试将其他表缓存下来,然后扫描最后一个表进行计算。
hive在这方面还有优化,
将大表放在JOIN的右边,这是就需要指定使用/*+ STREAMTABLE(…) */:
相当于告诉查询优化器哪个表是最大表
本文深入探讨了Hive SQL中的Join语句,包括左外连接、右外连接、内连接和全连接等类型,特别强调了左半开连接的特性。同时介绍了map-side join的优化策略,以及如何通过调整JOIN顺序来提升查询效率。
3066

被折叠的 条评论
为什么被折叠?



