Hive的Metastore三种配置方式

程序员喵姐

已于 2023-03-20 17:35:55 修改

阅读量5.3k

点赞数

于 2023-02-28 08:38:05 首次发布

本文链接：https://blog.youkuaiyun.com/weixin_42011858/article/details/129245456

版权

metastore是Hive元数据的存储中心，可以使用内嵌的Derby或外部的MySQL等数据库。内嵌配置适合单用户，而本地配置支持多用户，通过配置文件连接独立数据库。远程配置则让metastore服务与Hive进程分离，提高安全性和管理性，客户端无需数据库凭证。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

metastore 是 Hive 元数据的集中存放地。metastore 元数据存储主要体现在两个方面：服务和后台数据的存储。元数据包含用 Hive 创建的 database、table 等的元信息。元数据存储在关系型数据库中。如 Derby、MySQL 等。

客户端连接 metastore 服务，metastore 再去连接 MySQL 数据库来存取元数据。有了 metastore 服务，就可以有多个客户端同时连接，而且这些客户端不需要知道 MySQL 数据库的用户名和密码，只需要连接 metastore 服务即可。

一、内嵌配置

默认情况下，metastore 服务和 Hive 的服务运行在同一个 JVM 中，包含了一个内嵌的以本地磁盘作为存储的Derby（ Hive 自带的数据库）数据库实例。同时，这种配置也被称为内嵌配置。但是这种方式的不好之处就在于每次只有一个内嵌的 Derby 数据库可以访问某个磁盘上的数据文件，也就是说一次只能为每个 metastore 打开一个 hive 会话。如果尝试连接多个，会报错。这样效率很低。

二、本地配置

如果要支持多会话，或者多用户的话，需要使用一个独立的数据库（比如 mysql 比较常用），这种配置方式称为本地 metastore 配置。虽然这种方式 Hvie 服务和 Metastore 服务仍然在一个 JVM 进程中，但连接的却是另外一个进程中运行的数据库，在同一台机器上或者远程机器上。任何 JDBC 兼容的数据库都可以通过 javax.jdo.option.* 配置属性来供 metastore 使用。

这种安装方式和嵌入式的区别在于，不再使用内嵌的Derby作为元数据的存储介质，而是使用其他数据库比如MySQL来存储元数据。
hive服务和metastore服务运行在同一个进程中，mysql是单独的进程，可以同一台机器，也可以在远程机器上。
这种方式是一个多用户的模式，运行多个用户client连接到一个数据库中。这种方式一般作为公司内部同时使用Hive。
每一个用户必须要有对MySQL的访问权利，即每一个客户端使用者需要知道MySQL的用户名和密码才行。

<?xml version="1.0"?>
<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>
<configuration>
<property>
  <name>hive.metastore.warehouse.dir</name>
  <value>/user/hive_remote/warehouse</value>
</property>
<property>
  <name>hive.metastore.local</name>