[Hive]建表实例与参数解释——自定义表的存储格式(textfile、sequencefile、refile)

本文介绍了Hive中创建外部表的具体方法,并详细解释了几种常见的存储格式:textfile、sequencefile、rcfile及orcfile的特点和应用场景。通过对比不同格式之间的优劣,帮助读者理解如何选择合适的存储格式来提升数据处理效率。

一、建表实例

create external table `beatles_bi_dm.driver_butie_order_info`(
    `drive_license_number`    bigint   COMMENT '1',
    `drive_num`               bigint   COMMENT '2',
    `order_num`               bigint   COMMENT '3',
    `coupon_num`              bigint   COMMENT '4',
    `passenger_num`           bigint   COMMENT '5',
    `total_coupon_amount`     bigint   COMMENT '6'
    )
COMMENT '表描述'
PARTITIONED BY (
    `event_day` string)
ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t'
STORED AS orcfile
TBLPROPERTIES('creater'='me') --按键值对的格式为表增加额外的文档说明

二、表的存储格式

1、textfile

默认格式;

存储方式为行存储;

磁盘开销大 数据解析开销大;

但使用这种方式,hive不会对数据进行切分,从而无法对数据进行并行操作。

2、sequencefile

二进制文件,以<key,value>的形式序列化到文件中;
存储方式:行存储;
可分割 压缩;
一般选择block压缩;
优势是文件和Hadoop api中的mapfile是相互兼容的

3、refile

存储方式:数据按行分块 每块按照列存储;
压缩快 快速列存取;
读记录尽量涉及到的block最少;
读取需要的列只需要读取每个row group 的头部定义;
读取全量数据的操作 性能可能比sequencefile没有明显的优势,

4、orcfile

存储方式:数据按行分块 每块按照列存储;

压缩快 快速列存取;

效率比rcfile高,是rcfile的改良版本。

 

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值