Hive基本概念
Hive相当于是Hadoop的一个客户端,通过提交SQL,让Hive去解析封装成MapReduce任务,去HDFS读数据,去Yarn执行。
1.Hive简介
Hive是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张表,并提供类SQL查询功能。
Hive用于解决海量结构化日志的数据统计工具。
2.Hive本质
将HQL转化为MapReduce程序
(1)Hive处理的数据存储在HDFS上
(2)Hive分析数据底层的实现是MapReduce
(3)执行程序运行在Yarn上
Hive的优缺点
1.优点
(1)操作接口采用类SQL语法,提供快速开发的能力(简单、易上手)
(2)避免去写MapReduce,减少开发人员学习成本
(3)Hive的执行延迟比较高,因此Hive常用于数据分析ÿ