Vertica系列: 表的分段和分区-优快云博客

本文详细介绍了Vertica数据库中表的分段（segmentation）和分区（partition）的区别与设计规则。分段主要是为了解决数据在节点间的均衡分布，而分区则用于优化数据删除和空间回收。在分区设计时，应考虑数据删除策略，并避免超过1024个分区。推荐使用选择性好的字段或字段组合进行分段，同时给出了创建表的示例和相关DDL语句。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

Vertica 有两个数据分布的概念, segmentation 和 partition, 至少有下面几个区别:
1.目的方面:
segmentation 解决各节点数据倾斜问题, 适用于木桶原理, 数据量大的那个节点将会拖慢整个查询.
partition 主要解决的是数据删除和空间回收问题. 列式数据库删除数据的代价较大. 相比一条一条记录的删除动作, 删除整一个partition 的代价要小得多(其实一个partition就是一个文件). 当然一般情况下,分区也会在一定程度上改善查询效率.
2.Data locality 方面:
segmentation 是指数据在集群中各个节点的分布, 理想状态应该是数据均匀分布到各个节点.
partition 是指数据在单个节点上的分布.
3.DDL方面:
segmentation 是可在create table 和 create projection 语句中指定的, superprojection的segment是在建表语句中指定.
partition只能在create table 语句中指定的.

========================
分区设计规则:
========================
1. 按照 purge data的策略确定分区规则. 因为分区一个优势是快速回收空间, 所以可按照删除数据的方式确定如何分区, 比如将来是按月purge data,分区就选择月份; 如果将来可能按照年份purge data, 分区就选择年份. 而且, 建立分区的表达