十二、Spark SQL数据源 - Hive表

zlwm000

已于 2022-06-17 09:21:29 修改

阅读量2.3k

点赞数

文章标签： hive spark sql

于 2022-06-17 09:15:21 首次发布

本文链接：https://blog.youkuaiyun.com/zlwm000/article/details/125327185

版权

本文详细介绍了如何使用Spark SQL进行Hive数据的读写，包括创建SparkSession、执行HiveQL语句，如创建Hive表、导入数据、查询数据及指定存储格式等操作。同时，还讨论了Spark对Hive的支持以及配置hive-site.xml的重要性。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

Spark SQL支持读写Hive

Spark SQL还支持读取和写入存储在Apache Hive中的数据。然而，由于Hive有大量依赖项，这些依赖项不包括在默认的Spark发行版中，如果在classpath上配置了这些Hive依赖项，Spark就会自动加载它们。需要注意的是，这些Hive依赖项必须出现在所有Worker节点上，因为它们需要访问Hive序列化和反序列化库（SerDes），以便访问存储在Hive中的数据。
在使用Hive时，必须实例化一个支持Hive的SparkSession对象。若系统中没有部署Hive，则仍然可以启用Hive支持（Spark SQL充当Hive查询引擎）。Spark对Hive的支持包括连接到持久化的Hive元数据库、Hive SerDe、Hive用户定义函数、HiveQL等。如果没有配置hive-site.xml文件，Spark应用程序启动时，就会自动在当前目录中创建Derby元数据库metastore_db，并创建一个由spark.sql.warehouse.dir指定的数据仓库目录（若不指定，则默认启动Spark应用程序当前目录中的spark-warehouse目录）。需要注意的是，从Spark2.0.0版本开始，hive-site.xml中的hive.metastore.warehouse.dir属性不再使用了，代替的是使用spark.sql.warehouse.dir指定默认的数据仓库目录。