Kafka 分区器

分区器

消息在通过 send() 方法发往 broker 的过程中，有可能需要经过拦截器（Interceptor）、序列化器（Serializer）和分区器（Partitioner）的一系列作用之后才能被真正地发往 broker。拦截器（下一章会详细介绍）一般不是必需的，而序列化器是必需的。消息经过序列化之后就需要确定它发往的分区，如果消息 ProducerRecord 中指定了 partition 字段，那么就不需要分区器的作用，因为 partition 代表的就是所要发往的分区号。

如果消息 ProducerRecord 中没有指定 partition 字段，那么就需要依赖分区器，根据 key 这个字段来计算 partition 的值。分区器的作用就是为消息分配分区。

Kafka 中提供的默认分区器是 org.apache.kafka.clients.producer.internals.DefaultPartitioner，它实现了 org.apache.kafka.clients.producer.Partitioner 接口，这个接口中定义了2个方法，具体如下所示。

 public int partition(String topic, Object key, byte[] keyBytes, 
                     Object value, byte[] valueBytes, Cluster cluster);
public void close();

其中 partition() 方法用来计算分区号，返回值为 int 类型。partition() 方法中的参数分别表示主题、键、序列化后的键、值、序列化后的值，以及集群的元数据信息，通过这些信息可以实现功能丰富的分区器。close() 方法在关闭分区器的时候用来回收一些资源。

Partitioner 接口还有一个父接口 org.apache.kafka.common.Configurable，这个接口中只有一个方法：

 void configure(Map<String, ?> configs);

Configurable 接口中的 configure() 方法主要用来获取配置信息及初始化数据。

在默认分区器 DefaultPartitioner 的实现中，close() 是空方法，而在 partition() 方法中定义了主要的分区分配逻辑。如果 key 不为 null，那么默认的分区器会对 key 进行哈希（采用 MurmurHash2 算法，具备高运算性能及低碰撞率），最终根据得到的哈希值来计算分区号，拥有相同 key 的消息会被写入同一个分区。如果 key 为 null，那么消息将会以轮询的方式发往主题内的各个可用分区。

注意：如果 key 不为 null，那么计算得到的分区号会是所有分区中的任意一个；如果 key 为 null 并且有可用分区时，那么计算得到的分区号仅为可用分区中的任意一个，注意两者之间的差别。

在不改变主题分区数量的情况下，key 与分区之间的映射可以保持不变。不过，一旦主题中增加了分区，那么就难以保证 key 与分区之间的映射关系了。

除了使用 Kafka 提供的默认分区器进行分区分配，还可以使用自定义的分区器，只需同 DefaultPartitioner 一样实现 Partitioner 接口即可。默认的分区器在 key 为 null 时不会选择非可用的分区，我们可以通过自定义的分区器 DemoPartitioner 来打破这一限制。

 //代码清单4-4 自定义分区器实现
public class DemoPartitioner implements Partitioner {
    private final AtomicInteger counter = new AtomicInteger(0);
 
    @Override
    public int partition(String topic, Object key, byte[] keyBytes,
                         Object value, byte[] valueBytes, Cluster cluster) {
        List<PartitionInfo> partitions = cluster.partitionsForTopic(topic);
        int numPartitions = partitions.size();
        if (null == keyBytes) {
            return counter.getAndIncrement() % numPartitions;
        }else
            return Utils.toPositive(Utils.murmur2(keyBytes)) % numPartitions;
    }
 
    @Override public void close() {}
 
    @Override public void configure(Map<String, ?> configs) {}
}

实现自定义的 DemoPartitioner 类之后，需要通过配置参数 partitioner.class 来显式指定这个分区器。示例如下：

 props.put(ProducerConfig.PARTITIONER_CLASS_CONFIG,
        DemoPartitioner.class.getName());

这个自定义分区器的实现比较简单，读者也可以根据自身业务的需求来灵活实现分配分区的计算方式，比如一般大型电商都有多个仓库，可以将仓库的名称或 ID 作为 key 来灵活地记录商品信息。

posted @ 2023-02-24 23:43 Dazzling! 阅读(204) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

相关博文：

· kafka 拦截器

· Kafka 生产者客户端

· Kafka自定义分区器

· 大数据-58 Kafka 高级特性消息发送02-自定义序列化器、自定义分区器 Java代码实现原创

· kafka 生产者发送消息的分区策略

历史上的今天：
2021-02-24 P4549 【模板】裴蜀定理
2021-02-24 POJ1606 Jugs
2021-02-24 1103 Integer Factorization (30 分)

公告

昵称： Dazzling!
园龄： 5年1个月
粉丝： 8
关注： 5

+加关注

2025年3月

日

一

二

三

四

五

六

随笔分类

1. 1010 Radix (25 分)(1)

Dazzling

外婆坐在阳光下轻轻抚着我的发那远去的少年恍然间长大

Kafka 分区器

分区器

公告

搜索

常用链接

我的标签

积分与排名

随笔分类

随笔档案

文章分类

阅读排行榜

评论排行榜

推荐排行榜

最新评论

	public int partition(String topic, Object key, byte[] keyBytes,
	Object value, byte[] valueBytes, Cluster cluster);
	public void close();

	//代码清单4-4 自定义分区器实现
	public class DemoPartitioner implements Partitioner {
	private final AtomicInteger counter = new AtomicInteger(0);

	@Override
	public int partition(String topic, Object key, byte[] keyBytes,
	Object value, byte[] valueBytes, Cluster cluster) {
	List<PartitionInfo> partitions = cluster.partitionsForTopic(topic);
	int numPartitions = partitions.size();
	if (null == keyBytes) {
	return counter.getAndIncrement() % numPartitions;
	}else
	return Utils.toPositive(Utils.murmur2(keyBytes)) % numPartitions;
	}

	@Override public void close() {}

	@Override public void configure(Map<String, ?> configs) {}
	}

	props.put(ProducerConfig.PARTITIONER_CLASS_CONFIG,
	DemoPartitioner.class.getName());

外婆坐在阳光下 轻轻抚着我的发 那远去的少年 恍然间长大

分区器

公告

搜索

常用链接

积分与排名

随笔档案

外婆坐在阳光下轻轻抚着我的发那远去的少年恍然间长大