Kafka分区与group

最新推荐文章于 2025-06-26 17:28:01 发布

若水三千你是一千

最新推荐文章于 2025-06-26 17:28:01 发布

阅读量3.3w

点赞数 2

CC 4.0 BY-SA版权

分类专栏： Kafka 文章标签： kakfa partition groovy

本文链接：https://blog.youkuaiyun.com/daiyutage/article/details/70599433

Kafka 专栏收录该内容

6 篇文章

订阅专栏

本文详细介绍了Kafka中的分区(partition)机制及其与消费组(group)的关系。阐述了如何通过不同分区实现消息的并行处理，并解释了消费组内各消费者如何分配分区进行消息消费的过程。此外还说明了Kafka如何利用__consumer_offsets主题来存储和管理各个消费组的偏移量(offset)，以确保消息消费的进度能够正确保存。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

Kafka 分区与group

1.原理图

这里写图片描述
2.原理描述
一个topic 可以配置几个partition，produce发送的消息分发到不同的partition中，consumer接受数据的时候是按照group来接受，kafka确保每个partition只能同一个group中的同一个consumer消费，如果想要重复消费，那么需要其他的组来消费。Zookeerper中保存这每个topic下的每个partition在每个group中消费的offset
新版kafka把这个offsert保存到了一个__consumer_offsert的topic下
这个__consumer_offsert 有50个分区，通过将group的id哈希值%50的值来确定要保存到那一个分区.
这样也是为了考虑到zookeeper不擅长大量读写的原因。
所以，如果要一个group用几个consumer来同时读取的话，需要多线程来读取，一个线程相当于一个consumer实例。当consumer的数量大于分区的数量的时候，有的consumer线程会读取不到数据。
假设一个topic test 被groupA消费了，现在启动另外一个新的groupB来消费test，默认test-groupB的offset不是0，而是没有新建立，除非当test有数据的时候，groupB会收到该数据，该条数据也是第一条数据，groupB的offset也是刚初始化的ofsert, 除非用显式的用–from-beginnging 来获取从0开始数据
3.查看topic-group的offsert
位置：zookeeper
路径：[zk: localhost:2181(CONNECTED) 3] ls /brokers/topics/__consumer_offsets/partitions
在zookeeper的topic中有一个特殊的topic __consumer_offserts
计算方法：

 int hashCode =  Math.abs("ttt".hashCode());
 int partition = hashCode % 50;

先计算group的hashCode，再除以分区数(50),可以得到partition的值
使用命令查看：

kafka-simple-consumer-shell.sh --topic __consumer_offsets --partition 11 --broker-list localhost:9092,localhost:9093,localhost:9094 --formatter "kafka.coordinator.GroupMetadataManager\$OffsetsMessageFormatter"

11 是计算出来的分区
这里写图片描述
上图是打印出来的offsert信息,[group-id,topic,partition_id]
注意：kafka API consumer 消费数据的时候，会把offset保存在zookeeper中，所以下次可以接着消费，但是kafka-rest 不会。
4.参数
auto.offset.reset:默认值为largest，代表最新的消息，smallest代表从最早的消息开始读取，当consumer刚开始创建的时候没有offset这种情况，如果设置了largest，则为当收到最新的一条消息的时候开始记录offsert,若设置为smalert，那么会从头开始读partition