图解 Kafka 架构与工作原理-6ren

图解 Kafka 架构与工作原理

转载作者：qq735679552 更新时间：2022-09-27 22:32:09

29

4

CFSDN坚持开源创造价值，我们致力于搭建一个资源共享平台，让每一个IT人在这里找到属于你的精彩世界.

这篇CFSDN的博客文章图解 Kafka 架构与工作原理由作者收集整理，如果你对这篇文章有兴趣，记得点赞哟.

图解 Kafka 架构与工作原理

1、认识kafka

面试官提问：什么是 Kafka ?用来干嘛的？

官方定义如下:

Kafka is used for building real-time data pipelines and streaming apps. It is horizontally scalable, fault-tolerant, wicked fast, and runs in production in thousands of companies. 。

翻译过来，大致的意思就是，这是一个实时数据处理系统，可以横向扩展，并高可靠.

实时数据处理，从名字上看，很好理解，就是将数据进行实时处理，在现在流行的微服务开发中，最常用实时数据处理平台有 RabbitMQ、RocketMQ 等消息中间件.

这些中间件，最大的特点主要有两个:

服务解耦
流量削峰

在早期的 web 应用程序开发中，当请求量突然上来了时候，我们会将要处理的数据推送到一个队列通道中，然后另起一个线程来不断轮训拉取队列中的数据，从而加快程序的运行效率.

图解 Kafka 架构与工作原理

但是随着请求量不断的增大，并且队列通道的数据一致处于高负载，在这种情况下，应用程序的内存占用率会非常高，稍有不慎，会出现内存不足，造成程序内存溢出，从而导致服务不可用.

随着业务量的不断扩张，在一个应用程序内，使用这种模式已然无法满足需求，因此之后，就诞生了各种消息中间件，例如 ActiveMQ、RabbitMQ、RocketMQ 等中间件.

采用这种模型，本质就是将要推送的数据，不在存放在当前应用程序的内存中，而是将数据存放到另一个专门负责数据处理的应用程序中，从而实现服务解耦.

图解 Kafka 架构与工作原理

消息中间件：主要的职责就是保证能接受到消息，并将消息存储到磁盘，即使其他服务都挂了，数据也不会丢失，同时还可以对数据消费情况做好监控工作.

应用程序：只需要将消息推送到消息中间件，然后启用一个线程来不断从消息中间件中拉取数据，进行消费确认即可.

引入消息中间件之后，整个服务开发会变得更加简单，各负其责.

Kafka 本质其实也是消息中间件的一种，Kafka 出自于 LinkedIn 公司，与 2010 年开源到 github.

LinkedIn 的开发团队，为了解决数据管道问题，起初采用了 ActiveMQ 来进行数据交换，大约是在 2010 年前后，那时的 ActiveMQ 还远远无法满足 LinkedIn 对数据传递系统的要求，经常由于各种缺陷而导致消息阻塞或者服务无法正常访问，为了能够解决这个问题，LinkedIn 决定研发自己的消息传递系统，Kafka 由此诞生.

在 LinkedIn 公司，Kafka 可以有效地处理每天数十亿条消息的指标和用户活动跟踪，其强大的处理能力，已经被业界所认可，并成为大数据流水线的首选技术.

2、架构介绍

先来看一张图，下面这张图就是 kafka 生产与消费的核心架构模型.

图解 Kafka 架构与工作原理

如果你看不懂这些概念没关系，我会带着大家一起梳理一遍.

Producer：Producer 即生产者，消息的产生者，是消息的入口
Broker：Broker 是 kafka 一个实例，每个服务器上有一个或多个 kafka 的实例，简单的理解就是一台 kafka 服务器，kafka cluster表示集群的意思
Topic：消息的主题，可以理解为消息队列，kafka的数据就保存在topic。在每个 broker 上都可以创建多个 topic 。
Partition：Topic的分区，每个 topic 可以有多个分区，分区的作用是做负载，提高 kafka 的吞吐量。同一个 topic 在不同的分区的数据是不重复的，partition 的表现形式就是一个一个的文件夹!
Replication：每一个分区都有多个副本，副本的作用是做备胎，主分区(Leader)会将数据同步到从分区(Follower)。当主分区(Leader)故障的时候会选择一个备胎(Follower)上位，成为 Leader。在kafka中默认副本的最大数量是10个，且副本的数量不能大于Broker的数量，follower和leader绝对是在不同的机器，同一机器对同一个分区也只可能存放一个副本
Message：每一条发送的消息主体。
Consumer：消费者，即消息的消费方，是消息的出口。
Consumer Group：我们可以将多个消费组组成一个消费者组，在 kafka 的设计中同一个分区的数据只能被消费者组中的某一个消费者消费。同一个消费者组的消费者可以消费同一个topic的不同分区的数据，这也是为了提高kafka的吞吐量!
Zookeeper：kafka 集群依赖 zookeeper 来保存集群的的元信息，来保证系统的可用性。

简而言之，kafka 本质就是一个消息系统，与大多数的消息系统一样，主要的特点如下:

使用推拉模型将生产者和消费者分离
为消息传递系统中的消息数据提供持久性，以允许多个消费者
提供高可用集群服务，主从模式，同时支持横向水平扩展

与 ActiveMQ、RabbitMQ、RocketMQ 不同的地方在于，它有一个分区Partition的概念.

这个分区的意思就是说，如果你创建的topic有5个分区，当你一次性向 kafka 中推 1000 条数据时，这 1000 条数据默认会分配到 5 个分区中，其中每个分区存储 200 条数据.

这样做的目的，就是方便消费者从不同的分区拉取数据，假如你启动 5 个线程同时拉取数据，每个线程拉取一个分区，消费速度会非常非常快.

这是 kafka 与其他的消息系统最大的不同.

2.1、发送数据

和其他的中间件一样，kafka 每次发送数据都是向Leader分区发送数据，并顺序写入到磁盘，然后Leader分区会将数据同步到各个从分区Follower，即使主分区挂了，也不会影响服务的正常运行.

图解 Kafka 架构与工作原理

那 kafka 是如何将数据写入到对应的分区呢?kafka中有以下几个原则:

1、数据在写入的时候可以指定需要写入的分区，如果有指定，则写入对应的分区
2、如果没有指定分区，但是设置了数据的key，则会根据key的值hash出一个分区
3、如果既没指定分区，又没有设置key，则会轮询选出一个分区

2.2、消费数据

与生产者一样，消费者主动的去kafka集群拉取消息时，也是从Leader分区去拉取数据.

这里我们需要重点了解一个名词：消费组.

图解 Kafka 架构与工作原理

考虑到多个消费者的场景，kafka 在设计的时候，可以由多个消费者组成一个消费组，同一个消费组者的消费者可以消费同一个 topic 下不同分区的数据，同一个分区只会被一个消费组内的某个消费者所消费，防止出现重复消费的问题.

但是不同的组，可以消费同一个分区的数据.

你可以这样理解，一个消费组就是一个客户端，一个客户端可以由很多个消费者组成，以便加快消息的消费能力.

但是，如果一个组下的消费者数量大于分区数量，就会出现很多的消费者闲置.

如果分区数量大于一个组下的消费者数量，会出现一个消费者负责多个分区的消费，会出现消费性能不均衡的情况.

因此，在实际的应用中，建议消费者组的consumer的数量与partition的数量保持一致.

3、kafka 安装

光说理论可没用，下面我们就以 centos7 为例，介绍一下 kafka 的安装和使用.

kafka 需要 zookeeper 来保存服务实例的元信息，因此在安装 kafka 之前，我们需要先安装 zookeeper.

3.1、安装zookeeper

zookeeper 安装环境依赖于 jdk，因此我们需要事先安装 jdk 。

# 安装jdk1.8
yum -y install java-1.8.0-openjdk

下载zookeeper，并解压文件包。

#在线下载zookeeper
wget http://mirrors.hust.edu.cn/apache/zookeeper/zookeeper-3.4.12/zookeeper-3.4.12.tar.gz
#解压
tar -zxvf zookeeper-3.4.12.tar.gz

创建数据、日志目录。

#创建数据和日志存放目录
cd /usr/zookeeper/
mkdir data
mkdir log
#把conf下的zoo_sample.cfg备份一份，然后重命名为zoo.cfg
cd conf/
cp zoo_sample.cfg zoo.cfg

配置zookeeper 。

#编辑zoo.cfg文件
vim zoo.cfg

重新配置dataDir和dataLogDir的存储路径。

图解 Kafka 架构与工作原理

最后，启动 Zookeeper 服务。

#进入Zookeeper的bin目录
cd zookeeper/zookeeper-3.4.12/bin
#启动Zookeeper
./zkServer.sh start
#查询Zookeeper状态
./zkServer.sh status
#关闭Zookeeper状态
./zkServer.sh stop

3.2、安装kafka

到官网http://kafka.apache.org/downloads.html下载想要的版本，我这里下载是最新稳定版2.8.0.

#下载kafka 安装包
wget https://apache.osuosl.org/kafka/2.8.0/kafka-2.8.0-src.tgz
#解压文件包
tar -xvf kafka-2.8.0-src.tgz

按需修改配置文件server.properties(可选) 。

#进入配置文件夹
cd kafka-2.8.0-src/config
#编辑server.properties
vim server.properties

server.properties文件内容如下:

broker.id=0
listeners=PLAINTEXT://localhost:9092
num.network.threads=3
num.io.threads=8
socket.send.buffer.bytes=102400
socket.receive.buffer.bytes=102400
socket.request.max.bytes=104857600
log.dirs=/tmp/kafka-logs
num.partitions=1
num.recovery.threads.per.data.dir=1
offsets.topic.replication.factor=1
transaction.state.log.replication.factor=1
transaction.state.log.min.isr=1
log.retention.hours=168
log.segment.bytes=1073741824
log.retention.check.interval.ms=300000
zookeeper.connect=localhost:2181
zookeeper.connection.timeout.ms=6000
group.initial.rebalance.delay.ms=0

其中有四个重要的参数:

broker.id：唯一标识ID
listeners=PLAINTEXT://localhost:9092：kafka服务监听地址和端口
log.dirs：日志存储目录
zookeeper.connect：指定zookeeper服务地址

可根据自己需求修改对应的配置.

3.3、启动 kafka 服务

# 进入bin脚本目录
cd kafka-2.8.0-src/bin

启动 kafka 服务。

nohup kafka-server-start.sh ../config/server.properties server.log 2> server.err &

3.4、创建主题topics

创建一个名为testTopic的主题，它只包含一个分区，只有一个副本:

# 进入bin脚本目录
cd kafka-2.8.0-src/bin
#创建topics
kafka-topics.sh --create --zookeeper localhost:2181 --replication-factor 1 --partitions 1 --topic testTopic

运行list topic命令，可以看到该主题.

# 进入bin脚本目录
cd kafka-2.8.0-src/bin
#查询当前kafka上所有的主题
kafka-topics.sh --list --zookeeper localhost:2181

输出内容:

testTopic

3.5、发送消息

Kafka 附带一个命令行客户端，它将从文件或标准输入中获取输入，并将其作为消息发送到 Kafka 集群。默认情况下，每行将作为单独的消息发送.

运行生产者，然后在控制台中键入一些消息以发送到服务器.

# 进入bin脚本目录
cd kafka-2.8.0-src/bin
#运行一个生产者，向testTopic主题中发消息
kafka-console-producer.sh --broker-list localhost:9092 --topic testTopic

输入两条内容并回车:

Hello kafka!
This is a message

3.5、接受消息

Kafka 还有一个命令行使用者，它会将消息转储到标准输出.

# 进入bin脚本目录
cd kafka-2.8.0-src/bin
#运行一个消费者，从testTopic主题中拉取消息
kafka-console-consumer.sh --bootstrap-server localhost:9092 --topic testTopic --from-beginning

输出结果如下:

Hello kafka!
This is a message

4、小结

本文主要围绕 kafka 的架构模型和安装环境做了一些初步的介绍，难免会有理解不对的地方，欢迎网友批评、吐槽.

由于篇幅原因，会在下期文章中详细介绍 java 环境下 kafka 应用场景.

5、参考

1、知乎 - Java团长 - 再过半小时，你就能明白kafka的工作原理了。

原文链接：https://mp.weixin.qq.com/s/V3BlPGOuGPnmT36a500o7g 。

最后此篇关于图解 Kafka 架构与工作原理的文章就讲到这里了,如果你想了解更多关于图解 Kafka 架构与工作原理的内容请搜索CFSDN的文章或继续浏览相关文章，希望大家以后支持我的博客！。

29

4

0

文章推荐：一文秒懂Python中的字符串

文章推荐： java门禁系统面向对象程序设计

文章推荐：通过python读取txt文件和绘制柱形图的实现代码

文章推荐： CCF考试试题之门禁系统java解题代码

图解：什么是多租户？
大家好，我是汤师爷~ 什么是多租户？多租户是SaaS（软件即服务）领域里特有的一个概念。在SaaS服务中，“租户”指的就是使用这个SaaS系统的客户。那么租户和用户有什么区别呢？举个例子。假
什么是NoSQL的江湖称霸之路[图解]
1迷茫的小黑小黑最近有点郁闷。手头的工作不是特别喜欢，技术退步有点严重，于是想出去看看机会。小黑通过朋友内推，前几天去一家名叫宇节蹦跶的公司面试，被一些问题三连击直接跪掉了。图片
解决PyCharm无法使用lxml库的问题(图解)
前言很多朋友都会遇到这样的问题，明明在cmd中装好了lxml库，可pycharm就是运行不了，用pycharm自己的装库方法却装不上库…… 真让人恼火……………… 今天就来教大家怎
三十分钟MySQL快速入门(图解)
1、MySQL安装 MySQL的下载 http://dev.mysql.com/downloads/mysql/ MySQL版本选择 MySQL功能自定义选择安装功能自定义选择
pycharm无法安装第三方库的问题及解决方法以scrapy为例(图解)
很多次遇到在pycharm中无法安装第三方库的情况,今天我就遇到了,找了很多办法都没用但是在pycharm中配置anaconda环境之后再从anaconda下载安装你所需要的库就可以diy完决你
Docker在CentOS7下不能下载镜像timeout的解决办法(图解)
今天小编给大家记录下docker在centos7下不能下载镜像timeout的问题，先给大家说下问题的来龙去脉。问题描述：昨天买了六个月阿里云服务器的学生机用来部署毕设环境,在鼓捣docke
将程序桌面图标加到ubuntu启动器的方法(图解)
解决问题：因为FileZilla这个程序是直接解压缩之后便可以使用的，每次都需要到文件所在目录Filezilla/bin/filezilla下双击执行，太麻烦，若直接使用软链接的话也可以实现，s
透过ashx看浏览器服务器运行本质(图解)
浏览器与IIS服务器与.Net FrameWork关系 Asp.Net ASP.Net是一种动态网页技术，在服务器端运行.Net代码，动态生成HTML,然后响应给浏览器。
使用织梦cms做多语言的网站(图解)
织梦程序是国内比较多人使用的一套cms系统，用dedecms织梦程序如何做中英文网站，今天就给大家来一个详细的图文教程，希望能帮助到大家。以下所讲的和截图是本人用dedecms织梦程序制作过的一
各地首选dns地址大全【图解】
又是dns，小编最近写了好多关于dns的话题。当然小编今天写的与以往也略有不同，今天小编来告诉大家我们中国各地首选的dns地址各是什么。首选dns地址，顾名思义是是我们电脑上网时首选的地址。如果我
图解 Kafka 架构与工作原理
1、认识kafka 面试官提问：什么是 Kafka ?用来干嘛的? 官方定义如下： Kafka is used for building real-time data pipelines
完全卸载VSCode--解决卸载重新安装后还有原来配置的问题(图解)
VSCode卸载后进行重新安装，发现新安装的还有原来的一些配置，卸载的不彻底，有时候也容易出问题，可按照如下方法卸载干净： 1.进入控制面板卸载VSCode，也可以在VSCode的安装目录下用程序
解决win64 Python下安装PIL出错问题(图解)
1、软件版本首先我先安装了 python 2.7 pip是 8.1.2 2、当我要安装pil时，我在cmd下面输入：pip install pil 错误提示是： co
详述IntelliJ IDEA插件的安装及使用方法(图解)
intellij idea是一款非常优秀的软件开发工具，它拥有这强大的插件体系，可以帮助开发者完成很多重量级的功能。今天，我们来学习一下如何安装和卸载intellij idea的插件。 intel
SQL Server中的执行引擎入门图解
本文旨在分类讲述执行计划中每一种操作的相关信息。数据访问操作首先最基本的操作就是访问数据。这既可以通过直接访问表，也可以通过访问索引来进行。表内数据的组织方式分为堆(Heap)和B树，其中表
从0开始玩转WordPress——安装篇(图解)
看完这篇专题，你能在30分钟内在你的电脑上开始玩Wordpress，并向互联网上其他用户提供服务(如果可能:))。目录: 一;配置服务器; 二;调试服务器; 三;安装Wordpress;
详解在Ubuntu 中修改默认程序(图解)
CFSDN坚持开源创造价值，我们致力于搭建一个资源共享平台，让每一个IT人在这里找到属于你的精彩世界. 这篇CFSDN的博客文章详解在Ubuntu 中修改默认程序(图解)由作者收集整理，如果你对这篇文
【LeetCode链表#9】图解：两两交换链表节点
两两交换链表中的节点力扣题目链接(opens new window) 给定一个链表，两两交换其中相邻的节点，并返回交换后的链表。你不能只是单纯的改变节点内部的值，而是需要实
Intellij IDEA 热部署处理方法(图解)
1. 首先参考idea热部署同行经验分享: intellij idea 4种配置热部署的方法 2. idea 热部署实战： springboot项目：不要引入热部署工具包spring-boo
SQL Server 2005标准版安装方法[图解]
下载之后安装目录下 Servers的文件夹是服务端安装包，Tools文件夹是客户端安装包，SQL2005安装就必须先安装Tools(客户端)，之后再安装Servers，如果不按顺序安装SQL2005

首页

博学

6Ren·AI

商城

图解 Kafka 架构与工作原理

1、认识kafka