Hive默认是静态分区,我们在插入数据的时候要手动设置分区,如果源数据量很大的时候,那么针对一个分区就要写一个insert,比如说,我们有很多日志数据,我们要按日期作为分区字段,在插入数据的时候我们不可能手动的去添加分区,那样太麻烦了。还好,Hive提供了动态分区,动态分区简化了我们插入数据时的繁琐操作。
使用动态分区的时候必须开启动态分区(动态分区默认是关闭的),语句如下:
set hive.exec.hynamic.partition=true;
下面我们再介绍几个参数:
set hive.exec.dynamic.partition.mode=nonstrict
注:这个属性默认是strict,即限制模式,strict是避免全分区字段是动态的,必须至少一个分区字段是指定有值即静态的,且必须放在最前面。设置为nonstrict之后所有的分区都可以是动态的了。
set hive.exec.max.dynamic.partitions.pernode=10000
注:这个属性表示每个节点生成动态分区的最大个数,默认是100
set hive.exec.max.dynamic.partitions=100000
注:这个属性表示一个DML操作可以创建的最大动态分区数,默认是1000