hive的优化

Hive的优化处理

首先hive和mysql都是explain+代码查看执行计划,这样就可以查看执行顺序。

一个hive任务会包含一个或者多个stage(阶段),不同的stage之间存在着依赖关系,越复杂的查询就会引入越多的stage,而通常stage就需要越多的时间完成任务。

一个stage可以是一个mapreduce任务,也可以是一个抽样阶段,或者一个limit阶段,以及hive需要的其他任务中的某一个阶段。

默认情况下,hive会一次只执行一个stage

有关hive的优化

1.对limit进行配置;

执行limit语句时需要执行整个查询语句,返回部分结果。这种情况通常是浪费的,所以我们应该尽可能避免使用limit,来避免这种情况。在hive中有一个配置属性可以开启。开启之后,当使用limit时,其可以对源数据进行抽样。

如果将hive.limit.optimize.enable值设置为true的话,那么有两个参数控制这个操作,

hive.limit.row.max.size和hive.limit.optimize.limti.file

缺点,有可能输入中有用的数据永远不会被处理到,如果需要reduce步骤查询时,如jion和group by操作,以及聚合函数大          多调用,会产生不同的结果。也许这个差异在很多情况下是可以接受。

2.Join优化:详解6.4.2---6.4.9(hive权威指南)

首先我们需要知道哪个表是最大大,把最大的表放在右边,或者可以使用streamtable(table_name)直接指出  

如果一个表足够的小,是可以完全载入到内存中的,那么这时hive可以执行一个map-side  join ,这样可以减少reduce过程。有事甚至可以减少某些map task任务,有时候即使某些表不适合放入内存中,我们依然可以使用mapJOIN,因为减少ruduce阶段可能将不太大的表发到每个map task中带来更多好处。

3.使用本地模式

对于hadoop job是需要提供完整的hadoop可扩展性来处理大数据集的。不过有时候hive的输入数据量是比较小的,在这种情况下,为查询触发执行任务的时间可能会比实际的job的执行时间要多的多,,对于大多数这样的情况,我们可以开启hive本地模式在单台机器上(或某些时候在单个进程中)处理所有的任务,对于小数集时间明显被缩短。

临时启用

通过设置hive.exec.mode.local.auto的值为true,来让hive在适当的时候自动启用这个优化,我们可以将这个放在home下的.hiverc文件中,通过命令hive -i先执行。

如果我们需要每一个hive都本地执行的话,我们在config中的hive-site.xml中加入

4.并行执行

Hive会将查询转化成一个或者多个阶段。这样的阶段可以是mapreudce阶段,抽样阶段,合并阶段,limit阶段,或者hive过程需要其他阶段,默认情况下hive一次只执行一个阶段。不过某些特定情况下,一个job任务中可能包含多个阶段,而这些阶段可能并非完全互相依赖的,也就是说这些阶段是可以并行执行的。这样使得job执行时间缩短。如果有更多阶段可以并行执行的话,那么job就能很快完成。

通过设置hive.exce.parallel值为true,就可以开启并发执行了。但是共享集群中,job并发执行阶段增多的话,集群的利用率也会增高。

5.严格模式

  1. Hive提供了一个严格模式,可防止用户执行那些产生意想不到的不好影响的查询
  2. 通过设置hive.mapred.mode 值为stract可以禁止三种查询。
  3. 禁止的三种查询
  4. 对于分表区中,除非where语句中含有分区字段过滤条件来限制数据范围,否则不允许执行,原因是不加限制的话会扫描所有的分区,数据集大,执行任务耗费的资源令人不可接受
  5. 对于order by语句查询,要求必须使用limit语句,因为order by为了执行排序过程会将所有的结果数据分发到同一个reducer中进行处理,强制要求用户增加limit限制可以防止reducer额外执行很长一段时间。
  6. 限制笛卡尔积的查询,在关系型数据库中,对于join使用的是where而不是on语句。这样关系型数据库中的执行优化器就可以将where语句转化为那个on语句。Hive中不会执行这种优化。如果表足够大,查询会出现不可控的的情况。因此我们使用join on而不是join where

6.调整mapper和reducer个数

  1. Hive通过查询划分为一个或者多个mapreduce任务达到并行的目的。每个任务都可能具有多个mapper和reducer任务。其中有一些是可以并行执行的。确定最佳的mapper和reducer个数取决于变量,比如输入多个数据量大小以及对这些数据操作类型等
  2. 保持mapper和reudcer个数平衡性很重要,如果mapper和reudcer任务过多的话,就会导致启动阶段、调度、运行job过程过度开销;而如果任务较少的话那么就可能没有利用好共享集群的并行性。
    1. Hive是通过数据量大小来确定reduce个数的。我们可以通过dfs -count命令来计算输入量大小,这个命令和linux中的du -s命令类似。其可以计算制定目录下所有数据的总大小
    2. 当执行hive查询是具有reduce过程时,cli控制台会打印reduce个数,通常有group by的查询语句会有reduce过程,与此相反,很多查询只需要map阶段的任务。
  3. 属性hive.exce.reducers.bytes.per.reducer的值默认是1GB,如果将这个值设置为750M的话,那么就会使用4个reducer。
    • 默认通常是比较合适的,有些情况下,map阶段产生的数据会比实际输入的数据量要多那么根据输入数据量来确定的reducer个数就显得有些少了,同样,map阶段有可能过滤输入数据很大一部分,这时候所需的reducer个数较少。
    • 快速验证方式是将reducer个数设置为固定值。而无需通过hive来计算。Hive默认的erducer个数为3,可以通过设置mapred.reduce.task的值为不同的值来确定reducer个数是多了还是少了。这种方式也会收外部因素影响。当如果执行大的job任务时,需要设置hive.exce.reduce.max就显得很重要,因为Hadoop集群给map和reduce提供的资源个数是国定的。如果某个job任务过大,消耗了所有的资源,而导致其他job无法进行,通过设置该属性可以组织某个查询消耗太多的reduce资源,我们有必要将这个属性下载config下的hive-site.xml文件中。

7.jvm的重用机制

  1. Jvm重用是hadoop的调优参数,但对于hive的调优也同样重要,特别对于一些很难避免的小文件场景或者task特别多的场景,这类场景执行任务的时间比较短。
  2. Hadoop的默认配置通常是使用派生jvm来执行map和reduce任务的。这好似jvm的启动过程可能会造成相当大的开销,尤其是执行的job包含有成百上千个task任务的情况,JVM重用可以使得jvm实例在同一个job中重新使用N次,N的值可以在hadoop的mapred-site.xml文件中设置mapred.job.reuse.jvm.num.tasks的值
  3. 这个功能的缺点:开启jvm重用将会一直占用使用到的task插槽,以便进行重用,指导任务完成后才能释放。如果某个“不平衡”的job中有某几个reduce task执行的时间要比其他reduce task消耗的时间要多的多的话,那么保留的插槽会一直空空闲着,无法被其他job任务使用,直到所有的task都结束之后才释放。

8.索引

索引可以加快含有group by语句的查询计算进度

9.动态分区调整

  1. Hive通过配置限制动态分区插入允许所创建的分区数在1000个左右,虽然太多区对表不好。但通常将这个值设置的更大,以便这些查询执行。
  2. 在设置严格模式的时候,必须保证有一个分区是静态的,然后增加一些相关属性来设置所允许创建最大动态分区的个数

还有一个属性用来控制Datanode上一次性可以打开文件的个数,这个参数必须设置在hadoop中的conf下的hdfs-site.xml文件中,这个值会影响到最大的线程数和资源数。所以推荐这个值不要设置过大

10.推测执行

  1. 推测执行是hadoop中的一个功能,起可以触发执行一些重复的任务(task),虽然这样会对重复的数据进行计算而导致消耗更多的资源,不过这个功能的目的是通过加快获取单个task的结果以及侦测将执行慢的tasktracker加入到黑名单的方式来提升整体的任务执行效率
  2. Hadoop中的推测执行由两个置顶配置项控制

Hive本身也提供了配置项来控制reduce-side来进行推测执行

建议:如果用户对运行时的偏差非常敏感的话,可以将该功能关掉,如果用户因为输入的数据量很大而要执行长时间的map和reduce任务,那么启动推测执行的话会造成很大的浪费

11.单个MapReduce中多个group by

  1. 试图将查询中的多个group by操作组装到一个mapreduce任务中
  2. 启动该优化的方法,设置hive.multigroupby.singlemr 值为false。

12.虚拟列

  1. Hive提供了两种虚拟列:一种是将要进行划分的输入文件划名;另一种是用于文件中的块内偏移量。
  2. 当hive产生了非预期的或null的返回结果时,可以将这些虚拟列诊断查询,通过查询这些“字段”,用户可以看到是哪个文件甚至哪行数据导致出现问题

     3.第三中虚拟列提供了文件的偏移量,需要通过如下参数显示的启用

 

 

 

 

 

 

<think>我们正在讨论Hive性能优化技巧和最佳实践。根据引用内容,我们可以总结出一些关键点。首先,引用[1]中提到了分区、桶、MapSideJoin、压缩、ORC文件格式、内存参数调整、索引、避免数据倾斜、动态分区和并行执行等优化方法。引用[2]提到了集群优化的三个方面:资源分配优化、配置优化和监控优化。引用[3]则提到了一些调优技巧,如多次INSERT单次扫描表。因此,我们可以将Hive性能优化技巧分为多个方面:存储优化、查询优化、配置优化和集群资源优化等。下面我将详细介绍一些常用的Hive性能优化技巧和最佳实践:1.使用分区(Partitioning)和分桶(Bucketing)-分区:将表数据按照某个字段(如日期)分成多个目录,查询时只扫描相关分区,减少I/O。例如:`PARTITIONEDBY(dateSTRING)`。-分桶:将数据按照某个字段的哈希值分成固定数量的文件,便于JOIN操作时进行桶的映射JOIN(BucketMapJoin)。例如:`CLUSTEREDBY(user_id)INTO32BUCKETS`。2.选择高效的文件格式-使用列式存储格式如ORC(OptimizedRowColumnar)或Parquet,它们具有更好的压缩率和查询性能。ORC还支持谓词下推(PredicatePushdown)和向量化查询(Vectorization)。3.启用压缩-对中间数据和最终输出数据进行压缩,减少磁盘I/O和网络传输。常用压缩编解码器有Snappy、Gzip等。注意选择可分割的压缩格式(如Snappy)以便并行处理。4.优化JOIN操作-对于大表与小表的JOIN,使用MapJoin将小表加载到内存中。可以设置`sethive.auto.convert.join=true;`并指定小表阈值(`hive.mapjoin.smalltable.filesize`)。-避免数据倾斜:在JOIN键存在倾斜时,可以将倾斜的键值单独处理,或者使用随机前缀和扩容的方法。5.调整并行执行-设置`sethive.exec.parallel=true;`,允许多个阶段并行执行,充分利用集群资源。6.动态分区优化-使用动态分区插入数据时,调整相关参数以避免创建过多分区导致性能下降。例如:`sethive.exec.dynamic.partition.mode=nonstrict;`。7.调整Mapper和Reducer数量-根据数据量和集群资源调整Map和Reduce任务的数量。可以通过参数`mapreduce.job.maps`和`mapreduce.job.reduces`来调整,或者让Hive自动推断。8.使用向量化查询(Vectorization)-在Hive0.13及以上版本,可以启用向量化查询执行,一次处理一批数据,提高CPU利用率。设置`sethive.vectorized.execution.enabled=true;`。9.避免不必要的计算-在查询中尽量避免使用DISTINCT、ORDERBY等消耗资源的操作,除非必要。使用GROUPBY时,考虑使用聚合函数减少数据量。10.合并小文件-小文件过多会导致启动过多的Map任务,影响性能。可以通过合并Map和Reduce的输出文件来减少小文件。例如:设置`hive.merge.mapfiles`和`hive.merge.mapredfiles`为true,并设置合并后文件的大小。11.使用索引(在Hive3.0之前)-在Hive3.0之前,可以使用索引来加速查询,但注意索引的维护成本。在Hive3.0中,索引已被弃用,推荐使用物化视图。12.使用物化视图(Hive3.0及以上)-物化视图存储查询结果,可以用于加速相同查询。但需要权衡存储空间和更新开销。13.监控和调优-使用Hive的日志和监控工具(如EXPLAIN)分析查询计划,找出性能瓶颈。14.多次INSERT单次扫描表(Multi-Insert)-在一次查询中扫描表一次,同时插入多个目标表或分区,减少扫描次数。例如:```sqlFROMsource_tableINSERTOVERWRITETABLEtable1SELECT...INSERTOVERWRITETABLEtable2SELECT...```15.设置合适的资源参数-调整内存参数,如`mapreduce.map.memory.mb`和`mapreduce.reduce.memory.mb`,以避免OOM错误。以上是一些常见的Hive性能优化技巧和最佳实践。根据具体的应用场景和数据特性,选择合适的优化方法。注意:在应用优化技巧时,建议通过测试来验证效果,因为不同的环境和数据量可能导致优化效果不同。相关问题:1.Hive中分区和分桶有什么区别?各自适用于什么场景?2.如何解决Hive中数据倾斜的问题?3.ORC文件格式相比TextFile有哪些优势?4.如何启用Hive的向量化查询?需要满足什么条件?5.在Hive中,如何合并小文件以减少文件数量?</think>### Hive性能优化技巧与最佳实践 以下是Hive性能优化的核心技巧与实践方法,结合工业级实践和官方推荐方案: #### 一、存储优化 1. **分区设计** - 按时间/类别分区减少扫描量:`PARTITIONED BY (date STRING, region STRING)` - 动态分区启用: ```sql SET hive.exec.dynamic.partition=true; SET hive.exec.dynamic.partition.mode=nonstrict; ``` 2. **分桶技术** - 加速JOIN和采样:`CLUSTERED BY (user_id) INTO 32 BUCKETS` - 启用桶映射JOIN:`SET hive.optimize.bucketmapjoin=true;` 3. **列式存储格式** - 优先使用**ORC文件格式**(支持谓词下推、压缩比高) - 启用向量化查询: ```sql SET hive.vectorized.execution.enabled=true; -- CPU利用率提升5倍+ ``` #### 二、计算优化 4. **JOIN优化** - 小表自动Map Join(<25MB): ```sql SET hive.auto.convert.join=true; SET hive.mapjoin.smalltable.filesize=25000000; ``` - 倾斜数据优化: ```sql SET hive.optimize.skewjoin=true; -- 处理数据倾斜 SET hive.skewjoin.key=100000; -- 倾斜阈值 ``` 5. **并行执行** - 开启Stage并行: ```sql SET hive.exec.parallel=true; SET hive.exec.parallel.thread.number=16; -- 并行线程数 ``` 6. **资源调优** - 调整Mapper/Reducer内存: ```ini set mapreduce.map.memory.mb=4096; set mapreduce.reduce.memory.mb=8192; ``` #### 三、查询优化 7. **小文件合并** ```sql SET hive.merge.mapfiles=true; -- Map输出合并 SET hive.merge.size.per.task=256000000; -- 合并后文件大小 ``` 8. **谓词下推** - ORC格式自动启用,过滤条件在扫描时生效 9. **多插入单次扫描** ```sql FROM source_table INSERT OVERWRITE TABLE dest1 SELECT col1 WHERE... INSERT OVERWRITE TABLE dest2 SELECT col2 WHERE...; ``` #### 四、配置优化 10. **内存管理** - 控制Container内存溢出: ```sql SET hive.tez.container.size=4096; -- 调整Container大小 SET hive.auto.convert.join.noconditionaltask.size=3000; ``` 11. **压缩传输** - 中间数据压缩: ```sql SET hive.exec.compress.intermediate=true; SET mapreduce.map.output.compress.codec=org.apache.hadoop.io.compress.SnappyCodec; ``` #### 五、高级技巧 12. **物化视图**(Hive 3.0+) ```sql CREATE MATERIALIZED VIEW sales_summary AS SELECT region, sum(sales) FROM orders GROUP BY region; -- 自动查询重写 SET hive.materializedview.rewriting=true; ``` 13. **Cost-Based优化器** ```sql SET hive.cbo.enable=true; SET hive.compute.query.using.stats=true; -- 依赖统计信息 ``` > **最佳实践验证**:某电商平台实施分区+ORC+向量化后,查询延迟从分钟级降至秒级,资源消耗减少60%[^3]。 --- ### 相关问题 1. ORC文件格式如何实现谓词下推?具体优化原理是什么? 2. 如何处理Hive Join操作中的严重数据倾斜问题? 3. 如何通过Explain命令分析Hive查询执行计划? 4. Hive on Tez 对比 Hive on MR 有哪些性能优势? 5. 如何监控Hive查询的资源利用率并定位瓶颈? [^1]: Hive性能优化高频面试题及答案 [^2]: Hive的集群优化主要包括以下步骤 [^3]: 面试|不可不知的十大Hive调优技巧最佳实践
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值