如何通过Kafka分区策略和Ubuntu选型,助力高效运维?
- 内容介绍
- 文章标签
- 相关推荐
理解Kafka分区的主要
消息经过序列化后通过不同的分区策略找到对应的分区。至于分区,主题可以被分为若干个分区,同一个主题中的分区可以不在一个机器上...
一、 生产者侧如何选
生产者侧的选型。其实就两点:一个是分区数,另一个分区策略。分区数多了可以提高并发能力,但也要注意,分区太多也会增加运维成本。分区策略嘛,根据你的数据特性来定。
使用者痛点: 很多同学在生产环境中经常遇到“数据倾斜”问题。某个分区负载极高而其他分区空闲,直接导致资源利用率低下程序瓶颈出现。
从表2来看。生产者侧分区策略选择
二、 先分清两类“策略”
当然对于Topic-level configuration 配置都能修改,通过kafka官方提供的可修改列表。由于机器的频繁上下线,就会导致集群不断的进行选主操作。那么就会导致preferred replica分区不是Leader,就要重新去选,就可以通过如下操作进行。上面的是展示了如何将整个的TOPIC进行迁移,那么下面就来看看将其中的一部分进行迁移。
分区数量和并行度。这个嘛,得根据实际情况来定。通常分区数量是使用者数量的两倍左右比较合适。并行度嘛,就是一边处理的任务数,这个可以根据服务器的CPU主要数来定。
三、 使用者组侧如何选
使用者侧的选型,和使用者数量、数据读取模式有关。如使用者数量少,可以选择轮询策略;如使用者数量多,可以选择哈希策略,这样可以避免热点问题。
理解Kafka分区的主要
消息经过序列化后通过不同的分区策略找到对应的分区。至于分区,主题可以被分为若干个分区,同一个主题中的分区可以不在一个机器上...
一、 生产者侧如何选
生产者侧的选型。其实就两点:一个是分区数,另一个分区策略。分区数多了可以提高并发能力,但也要注意,分区太多也会增加运维成本。分区策略嘛,根据你的数据特性来定。
使用者痛点: 很多同学在生产环境中经常遇到“数据倾斜”问题。某个分区负载极高而其他分区空闲,直接导致资源利用率低下程序瓶颈出现。
从表2来看。生产者侧分区策略选择
二、 先分清两类“策略”
当然对于Topic-level configuration 配置都能修改,通过kafka官方提供的可修改列表。由于机器的频繁上下线,就会导致集群不断的进行选主操作。那么就会导致preferred replica分区不是Leader,就要重新去选,就可以通过如下操作进行。上面的是展示了如何将整个的TOPIC进行迁移,那么下面就来看看将其中的一部分进行迁移。
分区数量和并行度。这个嘛,得根据实际情况来定。通常分区数量是使用者数量的两倍左右比较合适。并行度嘛,就是一边处理的任务数,这个可以根据服务器的CPU主要数来定。
三、 使用者组侧如何选
使用者侧的选型,和使用者数量、数据读取模式有关。如使用者数量少,可以选择轮询策略;如使用者数量多,可以选择哈希策略,这样可以避免热点问题。

