hive中的桶表，以及高效的join方式

最新推荐文章于 2025-11-30 22:37:22 发布

原创最新推荐文章于 2025-11-30 22:37:22 发布 · 8.0k 阅读

26 ·

CC 4.0 BY-SA版权

文章标签：

#大数据 #hive

hive 专栏收录该内容

3 篇文章

订阅专栏

本文介绍了Hive中的桶（SMB）策略，一种用于优化大表间Join操作的方法。通过将大表分解为小表并在Map阶段进行Join，显著提高了查询效率。文章详细解释了桶的创建过程及桶Join的工作原理。

hive中的join策略大概可以分为三种

这里写图片描述

前面2种的话都是经常会用到，说下第三种桶 join

桶（SMB）

物理上，每个桶就是表(或分区）目录里的一个文件。
smb的设计是为了解决大表和大表之间的join的。简单的说下她的思想：大表化成小表，map side join 解决。经典的分而治之的思想。

对一个表或者一个分区，可以将其划分为更细的数据块，桶。在hive中，分桶的方式采取的是：对列的值进行hash除以桶的数量取余；

为什么要对数据进行分桶：

桶给表加上了额外的结构，在进行某些查询的时候可以利用这个结构进行高效的查询；例如：对于两个数据表，某两列都做了桶划分，可以使用map端的join高效的完成join（桶和桶之间的join，大大减少了join的次数）。
对于数据取样更加高效

创建桶划分的表

CREATE TABLE bucketed_user (id INT) name STRING) 
CLUSTERED BY (id) INTO 4 BUCKETS;

用CLUSTERED BY (id) INTO 4 BUCKETS 分别指定需要进行分桶的列和需要分桶的数量；

在这里，我们使用用户ID来确定如何划分桶(Hive使用对值进行哈希并将结果除以桶的个数取余数。这样，任何一桶里都会有一个随机的用户集合（PS：其实也能说是随机，不是吗？）。
对于map端连接的情况，两个表以相同方式划分桶。处理左边表内某个桶的 mapper知道右边表内相匹配的行在对应的桶内。因此，mapper只需要获取那个桶 (这只是右边表内存储数据的一小部分)即可进行连接。这一优化方法并不一定要求两个表必须桶的个数相同，两个表的桶个数是倍数关系也可以。

桶中的数据可以根据一个或多个列另外进行排序。由于这样对每个桶的连接变成了高效的归并排序(merge-sort), 因此可以进一步提升map端连接的效率。以下语法声明一个表使其使用排序桶：

CREATE TABLE bucketed_users (id INT, name STRING) 
CLUSTERED BY (id) SORTED BY (id ASC) INTO 4 BUCKETS;

使用tips:
两个表join的时候，小表不足以放到内存中，但是又想用map side join这个时候就要用到bucket Map join。其方法是两个join表在join key上都做hash bucket，并且把你打算复制的那个（相对）小表的bucket数设置为大表的倍数。这样数据就会按照join key做hash bucket。小表依然复制到所有节点，Map join的时候，小表的每一组bucket加载成hashtable，与对应的一个大表bucket做局部join，这样每次只需要加载部分hashtable就可以了。

ps：map side join其实也是有局限性的。他要求从表的数据量较小；从表：left join的右表，right join 的左表。

bucket map join
set Hive.optimize.bucketMapjoin = true;
select /*+Mapjoin(a) */count(*)
from Map_join_test a
join Map_join_test b on a.id = b.id;

我们如何保证表中的数据都划分成桶了呢？把在Hive外生成的数据加载到划分成桶的表中，当然是可以的。其实让Hive来划分桶更容易。

对于已存在的表

Hive并不检查数据文件中的桶是否和表定义中的桶一致(无论是对于桶的数量或用于划分桶的列）。如果两者不匹配，在査询时可能会碰到错误或未定义的结果。因此，建议让Hive来进行划分桶的操作。
相关的操作：
要向分桶表中填充成员，需要将 hive.enforce.bucketing 属性设置为 true。①这样，Hive 就知道用表定义中声明的数量来创建桶。然后使用 INSERT 命令即可。需要注意的是： clustered by和sorted by不会影响数据的导入，这意味着，用户必须自己负责数据如何如何导入，包括数据的分桶和排序。
‘set hive.enforce.bucketing = true’ 可以自动控制上一轮reduce的数量从而适配bucket的个数，当然，用户也可以自主设置mapred.reduce.tasks去适配bucket个数，推荐使用’set hive.enforce.bucketing = true’

取样
SELECT * FROM users 
TABLESAMPLE(BUCKET 1 OUT OF 4 ON rand());

一个完整的例子：

创建表


1   create table student(id INT, age INT, name STRING)
2   partitioned by(stat_date STRING)
3   clustered by(id) sorted by(age) into 2 buckets
4   row format delimited fields terminated by ',';
5    
6   create table student1(id INT, age INT, name STRING)
7   partitioned by(stat_date STRING)
8   clustered by(id) sorted by(age) into 2 buckets
9   row format delimited fields terminated by ',';

设置参数

set hive.enforce.bucketing = true;

插入数据

insert overwrite table student1 partition(stat_date="20120802")
select id,age,name where stat_date="20120802" sort by age;

疑问：插入的数据没有按照age 排序，在桶表中会怎么表现，还是高效的merge-sort模型吗？
用load data的方式增加进去的方式，不会按照建表的时候制定的排序字段进行排序，如果是insert 的方式进行数据的插入，是会按照建表的时候制定的字段进行排序的。
注意
ps：想要使用两张桶表进行join的时候，两个表进行交叉的字段必须是唯一的，不满足这个条件join出来的结果是错的。

抽样

hive> select * from student1 tablesample(bucket 1 out of 2 on id);

Total MapReduce jobs = 1
Launching Job 1 out of 1
.......
OK
4       18      mac     20120802
2       21      ljz     20120802
6       23      symbian 20120802
Time taken: 20.608 seconds

注：tablesample是抽样语句，语法：TABLESAMPLE(BUCKET x OUT OF y)
y必须是table总bucket数的倍数或者因子。hive根据y的大小，决定抽样的比例。例如，table总共分了64份，当y=32时，抽取(64/32=)2个bucket的数据，当y=128时，抽取(64/128=)1/2个bucket的数据。x表示从哪个bucket开始抽取。例如，table总bucket数为32，tablesample(bucket 3 out of 16)，表示总共抽取（32/16=）2个bucket的数据，分别为第3个bucket和第（3+16=）19个bucket的数据。