ElasticSearch中,集群(Cluster),节点(Node),分片(Shard),Indices(索引),replicas(备份)之间的关系

Cluster包含多个node,Indices不应该理解成动词索引,Indices可理解成关系数据库中的databases,Indices可包含多个Index,Index对应关系数据库中的database,它是用来存储相关文档的。

Elasticsearch与关系数据的类比对应关系如下:

Relational DB ⇒ Databases ⇒ Tables ⇒ Rows ⇒

ColumnsElasticsearch ⇒ Indices ⇒ Types
⇒ Documents ⇒ Fields

这里的document的可以理解为一个JSON序列对象。每个document可包含多个field。再来说说Shard,每个Index(对应Database)包含多个Shard,默认是5个,分散在不同的Node上,但不会存在两个相同的Shard存在一个Node上,这样就没有备份的意义了。Shard是一个最小的Lucene索引单元。

转载自:
作者:赵光明
链接:https://www.zhihu.com/question/26446020/answer/42049774
来源:知乎
著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。

<think>嗯,用户之前问过关于Elasticsearch分布式架构如何处理节点故障的问题,现在又接着问分片和副本。看来他们可能是在学习ES的分布式机制,或者是正在搭建集群需要了解这些概念。 首先,用户之前的问题是关于节点故障的自动处理,所以现在问分片和副本应该是想深入理解数据存储和冗余的机制。分片和副本是ES实现高可用和扩展性的核心,需要详细解释两者的区别和联系。 用户可能不太清楚分片和副本的作用,或者混淆了它们的概念。需要明确分片是数据分割的单位,而副本是分片的复制,用于故障恢复和负载均衡。可能还需要举例说明,比如索引如何被分成多个分片,每个分片如何有副本。 另外,用户可能关心实际应用中的配置,比如如何设置分片数和副本数,最佳实践是什么。需要提到分片过多或过少的影响,副本数量的调整对集群性能的影响,以及如何根据硬件资源来规划。 还要注意用户可能的误区,比如认为增加副本可以无限提高性能,但实际上副本会占用存储和计算资源。需要解释平衡可用性和资源消耗的重要性。 用户可能还需要知道分片和副本在故障恢复中的具体作用,比如主分片失效时副本如何提升为主分片,恢复过程中数据如何同步。这部分可以结合之前的节点故障处理机制来回答,形成知识连贯性。 最后,可能还需要提到一些常见问题,比如分片无法分配的原因,如何监控分片状态,以及调整分片和副本时的注意事项。这些实际操作的内容对用户来说可能非常实用。</think>### Elasticsearch 分片Shard)与副本(Replica)详解 --- #### 一、核心概念对比 | 特性 | **分片Shard)** | **副本(Replica)** | |-------------|--------------------------------------|--------------------------------------| | **本质** | 数据的最小物理存储单元 | 分片的完整拷贝 | | **类型** | 主分片(Primary) / 副本分片(Replica)| 只能是主分片的副本 | | **读写权限** | 主分片可读写,副本分片默认只读 | 仅响应查询请求 | | **创建时机** | 索引创建时固定数量(不可修改) | 可动态调整数量 | | **作用目标** | 解决**数据水平扩展**问题 | 解决**高可用**和**查询负载均衡**问题 | --- #### 二、技术实现细节 ##### 1. **分片工作机制** - **分片公式**: $$ \text{总数据存储量} = \text{主分片数} \times (1 + \text{副本数}) \times \text{单分片数据量} $$ - **路由机制**: 文档通过哈希算法分配到指定主分片: $$ \text{shard\_num} = hash(\_routing) \% \text{num\_primary\_shards} $$ - **分片限制**: 单个分片建议大小在 `10GB-50GB`(超过 `100GB` 可能影响性能) ##### 2. **副本运作原理** - **实时同步**: 主分片通过 `Translog` 保证数据变更顺序,副本采用 `pull` 模式同步数据 - **一致性模型**: - **同步写入**:需多数副本确认(通过 `wait_for_active_shards` 参数控制) - **异步刷新**:默认每秒刷新(`refresh_interval=1s`) --- #### 三、配置与优化策略 ##### 1. **分片数量决策** - **黄金法则**: 分片总数 = 节点数 &times; 单节点承载分片数(建议 `500-1000`/节点) 例如:3节点集群,单节点承载上限 800 分片 → 总容量约 `2400` 分片 - **动态调整限制**: 主分片数创建后不可变,只能通过 `Reindex API` 重建索引调整 ##### 2. **副本配置技巧** ```json // 创建索引时指定分片配置 PUT /my_index { "settings": { "number_of_shards": 3, // 主分片数 "number_of_replicas": 2 // 每个主分片的副本数 } } // 动态修改副本数(实时生效) PUT /my_index/_settings { "number_of_replicas": 1 } ``` ##### 3. **性能优化要点** - **冷热分离架构**: 使用 `ILM(Index Lifecycle Management)` 将旧索引副本数降为 `0` - **写入优化**: 临时关闭副本(`index.number_of_replicas=0`)提升批量导入速度 - **查询加速**: 增加副本可实现读请求的**多副本负载均衡** --- #### 四、故障场景应对 ##### 1. **分片未分配(UNASSIGNED)** - **常见原因**: - 磁盘空间不足(`85%` 水位线触发只读模式) - 节点属性不匹配分配规则(如 `rack` 标签约束) - **解决方案**: ```bash # 强制分配分片(慎用) POST /_cluster/reroute { "commands": [{ "allocate_stale_primary": { "index": "my_index", "shard": 0, "node": "node-1", "accept_data_loss": true } }] } ``` ##### 2. **副本同步延迟** - **检测方法**: ```bash GET /_cat/shards?v&h=index,shard,prirep,state,docs,store ``` - **处理方案**: - 检查网络带宽(`indices.recovery.max_bytes_per_sec`) - 优化映射字段类型,减少 `_source` 体积 --- #### 五、最佳实践总结 1. **容量规划**: - 预估数据总量 → 确定主分片数 - 根据 SLA 要求 → 确定副本数(生产环境至少 `1` 副本) 2. **硬件匹配原则**: - 单个分片数据量 ≈ 节点内存的 `1/10`(如 `64GB` 内存 → 分片大小 `6-7GB`) - 使用 `SSD` 磁盘降低副本同步延迟 3. **监控关键指标**: - `indices.search.fetch_current`(副本查询负载) - `indices.indexing.index_current`(主分片写入压力) - `thread_pool` 的 `write`/`search` 队列深度 4. **特殊场景处理**: - **时序数据**:使用 `Rollover API` 自动创建新分片 - **全局搜索**:设置 `preference=_primary` 强制主分片查询 --- #### 六、经典误区解析 - **误区1**:"增加副本数一定能提升查询性能" ✅ 实际:当查询为 `CPU 密集型` 时,过多副本可能引发线程竞争 - **误区2**:"主分片越多越好" ✅ 实际:分片过多会导致 `元数据管理开销` 指数级增长 - **误区3**:"副本可以替代备份" ✅ 实际:副本不能防范 `误删除`,仍需 `Snapshot` 实现真正备份 --- 通过合理配置分片与副本,可在**数据可靠性**、**查询性能**、**硬件成本**之间找到最佳平衡点。建议通过 `Elasticsearch Rally` 进行分片方案的基准测试验证。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值