Kafka Streams, 我还会再使用它吗?
yuyutoo 2025-06-09 07:06 4 浏览 0 评论
Deepti Mittal 4分钟阅读
Kafka Streams是一个用于构建应用程序和微服务的客户端库,其中的输入和输出数据都存储在Apache Kafka集群中。它将在客户端编写和部署标准的Java和Scala应用程序的简单性与Kafka的服务器端集群技术的优势相结合。
我们在一个数据量很大的项目中使用了kafka流。后来我们发现Kafka流对于我们的用例来说不是一个好的选择。
用例细节
收集发布在多个Kafka主题中的记录数量,当时间表启动/收到特定的触发器时,对这些记录运行算法,并发布在另一个Kafka主题中,供下游系统使用。
这听起来像是一个简单的用例,在我们开始用实际数据运行之前,没有人能够想到这将导致任何问题。我们的记录大小约为5KB。为了运行算法,我们需要在某些层面上聚合它们,这导致了5GB或更大的单一kafka记录。
所以我们开始挖掘Kafka流是否能够支持这种使用情况。这篇博客是关于我们对Kafka流的实际经验,在哪些地方可以使用,哪些地方需要避免。
很适合Kafka流
- 快速原型设计。如果你有想要快速建立原型的想法,Kafka流可能是不错的选择。它提供了很多高水平的API,可以帮助快速测试算法和概念。使用kafka流提供的过滤、聚合和转换API可以使开发变得非常快。
- 小型处理或数据验证。在这种情况下,我们从一个主题中获取数据,并在将其提供给下游系统之前进行小规模的处理和验证,Kafka流可能是很合适的。请记住,处理必须是非常小的,否则你会开始得到像producerFenced和TransactionCommitOperation失败的异常。
- 弹性和容错。Kafka流使用本地状态存储和变化日志主题,数据在聚合过程中被保存,可以在故障情况下使用,整个处理过程不需要重新开始。整个交易和错误处理的概念都由库来处理,开箱即用。
关于Kafka流的问题
- 需要有小型交易。如果你需要在传入的数据上运行复杂的算法,并且需要花费超过几毫秒的时间,那么Kafka流可能不是很合适,因为它会导致超时。人们总是可以争辩说你可以增加超时,但是Kafka在消费者、经纪人、生产者和流层面都有多种超时,而且其中很多都是相关的。让整个组合正确并不是一件容易的事。你永远不可能100%确定这些超时会在所有的数据和生产场景中发挥作用。
- 大的有效载荷。这是我们远离Kafka流的主要原因。为了执行其中的一个算法,我们需要在更高的层面上汇总所有的记录,这就导致了一个大小为5GB的记录进入到变化日志主题中。Kafka流无法将这个巨大的信息保存到主题中,导致了多次失败和巨大的性能下降。Kafka流的建议是记录大小不超过10MB。
- 批量处理。这是一个流媒体解决方案,应该作为流媒体使用,如果你试图执行需要收集多条记录的操作,你可能会遇到像我上面提到的问题。这也可能导致更大的交易,因此你会得到很多错误。
- 可调试性。在Kafka中,大量的producerFenced异常、提交事务失败的异常没有很好的描述,在Kafka流中分析和调试它们变得更加困难,因为你将使用高DSL函数构建拓扑结构,它成为分析错误的黑盒子。使用Spring Kafka实现的那部分解决方案对我们来说很容易分析和解决,但Kafka流的问题却很难解决,尽管我们花了好几天时间也不知道RCA。
- 隐藏的流主题。在查看流代码时,你永远无法发现有多少流主题被创建,除非你使用一些外部工具来可视化流的拓扑结构。当我们开始使用AKHQ查看主题和消费者组时,我们意识到流创建了许多重新分区和变化日志主题。所有容易使用的DSL功能都是有成本的,因为这些额外的主题会在很大程度上增加kafka集群的数据空间,而且在向changelog主题写入和读取数据时也会涉及大量的网络I/O。
- 流配置。Kafka对经纪人、消费者和生产者有太多的配置。很多配置是相互关联的,这可能会在很大程度上影响性能。当使用Kafka流时,它提供了另一套配置,进一步增加了复杂性。
- 不平衡的负载分配:在Kafka中实现并行的一个方法是增加分区和消费者。在简单的Kafka解决方案中,这种计算是非常容易的,但在Kafka流中,由于子结构和流主题的参与,你可能无法找出所需的消费者的确切数量,这导致在运行多个消费者的机器上的不平等的负载分布。这个问题可以在观察消费者的分区分配时得到解决,但是第一次发现这个问题并不容易。
所有这些问题迫使我们放弃了Kafka流,我们决定使用外部数据存储来实现容错和弹性。
我们必须在我们的解决方案中实现事务和错误处理,但这是值得的,因为作为回报,我们得到了解决方案的可调试性,这对于在生产中运行的系统是最重要的。
相关推荐
- 高一高二第一次月考认真作答(高二第一次月考的重要性)
-
正在进行高一、高二第一次月考,同学们正在认真完成化学试卷,研究考纲,探究考点,夯实基础,迎战高考!
- 山清水秀,盛世今朝(山清水秀出处)
-
万千星河,神州妖娆!山清水秀,盛世今朝!龙腾虎跃,锦绣前程!千里婵娟,祝福永远!
- 我校二模成绩已新鲜出炉(二模考试成绩)
-
充电加油备战高考,积极努力再拼一搏...
- Argon Design向瑞萨电子有限公司提供Argon Streams VP9许可证
-
英国剑桥--(美国商业资讯)--领先的先进视频验证解决方案提供商ArgonDesignLtd已与日本半导体公司瑞萨电子有限公司(RenesasElectronicsCorporation)签署...
- 高考倒计时75天(高考倒计时75天励志语)
-
今天是2022年3月24日星期四,距离2022年高考还有75天时间对于十八岁的高三学子来说,有些事情的确会影响你们的一生,但是没有一件事能决定你们的一生!努力的意义,就是:以后的日子里,放眼望去,全...
- 期中考试正在进行(期中考试在即)
-
转眼即瞬,期中考试已到,紧张忙碌的两个月学习,检验的时刻到了。让我们拿出信心和勇气,来挑战自我。面对考验,我们该做的就是沉着,冷静。让知识来一次次洗礼我们的灵魂,让失败和成功迎接一次次的成长。你们可以...
- 不要浪费了你NAS上的HDMI接口!详解华硕NAS上HDMI接口的妙用
-
不要浪费了你NAS上的HDMI接口!详解华硕NAS上HDMI接口的妙用之前我在本站分享我使用的华硕(ASUS)AS6704T...
- Java通过Kafka Streams库来实现数据流处理
-
#暑期创作大赛#...
- From abandoned mines to limpid streams waters: how banks profit from EOD
-
ByZENGYanglinInthecurrentpursuitofthe“dualcarbon”target(carbonpeakingandcarbonneutra...
- SPSS与Streams的集成实现实时预测
-
SPSSModeler是一个数据挖掘工作台,提供了一个可了解数据并生成预测模型的最先进的环境。Streams提供了一个可伸缩的高性能环境,对不断变化的数据进行实时分析,这些数据中包括传统结构的数据...
- Kafka Streams, 我还会再使用它吗?
-
DeeptiMittal4分钟阅读...
- 大数据Hadoop之——Kafka Streams原理介绍与简单应用示例
-
一、KafkaStreams概述官网文档:https://kafka.apache.org/32/documentation/streams/...
- Android上的TCP今天开始向用户推出,并将在下个月向所有用户提供
-
据extends网3月15日报道,Firefox今天宣布,其保护用户免受跟踪器攻击的全面cookie保护(TCP)功能现已在Android上可用。该功能默认启动模式,这样,跟踪器将无法收集有关用户的浏...
- Linux curl命令(linux curl命令安装)
-
Linuxcurl命令是一个利用URL规则在命令行下工作的文件传输工具。它支持文件的上传和下载,所以是综合传输工具,但按传统,习惯称curl为下载工具。作为一款强力工具,curl支持包括HTTP、H...
- go语言http服务入门详解(go语言http服务器)
-
当你在浏览器中输入URL时,实际上是在发送一个对Web页面的请求。该请求被发送到服务器。服务器的工作是获取适当的页面并将其作为响应发送回浏览器。在Web的早期,服务器通常读取服务器硬盘上HTML文件的...
你 发表评论:
欢迎- 一周热门
-
-
前端面试:iframe 的优缺点? iframe有那些缺点
-
带斜线的表头制作好了,如何填充内容?这几种方法你更喜欢哪个?
-
漫学笔记之PHP.ini常用的配置信息
-
推荐7个模板代码和其他游戏源码下载的网址
-
其实模版网站在开发工作中很重要,推荐几个参考站给大家
-
[干货] JAVA - JVM - 2 内存两分 [干货]+java+-+jvm+-+2+内存两分吗
-
正在学习使用python搭建自动化测试框架?这个系统包你可能会用到
-
织梦(Dedecms)建站教程 织梦建站详细步骤
-
【开源分享】2024PHP在线客服系统源码(搭建教程+终身使用)
-
2024PHP在线客服系统源码+完全开源 带详细搭建教程
-
- 最近发表
-
- 高一高二第一次月考认真作答(高二第一次月考的重要性)
- 山清水秀,盛世今朝(山清水秀出处)
- 我校二模成绩已新鲜出炉(二模考试成绩)
- Argon Design向瑞萨电子有限公司提供Argon Streams VP9许可证
- 高考倒计时75天(高考倒计时75天励志语)
- 期中考试正在进行(期中考试在即)
- 不要浪费了你NAS上的HDMI接口!详解华硕NAS上HDMI接口的妙用
- Java通过Kafka Streams库来实现数据流处理
- From abandoned mines to limpid streams waters: how banks profit from EOD
- SPSS与Streams的集成实现实时预测
- 标签列表
-
- mybatis plus (70)
- scheduledtask (71)
- css滚动条 (60)
- java学生成绩管理系统 (59)
- 结构体数组 (69)
- databasemetadata (64)
- javastatic (68)
- jsp实用教程 (53)
- fontawesome (57)
- widget开发 (57)
- vb net教程 (62)
- hibernate 教程 (63)
- case语句 (57)
- svn连接 (74)
- directoryindex (69)
- session timeout (58)
- textbox换行 (67)
- extension_dir (64)
- linearlayout (58)
- vba高级教程 (75)
- iframe用法 (58)
- sqlparameter (59)
- trim函数 (59)
- flex布局 (63)
- contextloaderlistener (56)