- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我最近开始使用 Apache Storm 向大数据世界介绍自己。我遇到了以下问题,想了很多如何解决它,但我所有的方法似乎都很幼稚。
Apache Storm 0.9.3,Java 1.8.0_20
有一个很大的 xml 文件 (~400MB) 需要逐行读取 (xml-file-spout)。然后,每个读取的文件行都由一系列 bolt 发出并处理。
它必须是有保证的消息处理(发射锚定...)
就文件相当大(包含大约 200 亿行)而言,我使用扫描仪读取它,基于缓冲流而不是将整个文件加载到内存中。到目前为止,一切都很好。当处理过程中某处出现错误时,问题就会出现:xml-file-spout 本身已死,或者存在一些内部问题......
解决第一个问题的最初想法是将当前状态保存在某个地方:分布式缓存、JMS 队列、本地磁盘文件。当 spout 打开时,它应该找到这样的存储,读取状态并从指定的文件行开始。这里我也想过将状态存储在Storm的Zookeeper中,但不知道是否可以从spout中寻址Zookeeper(有没有这种能力)?您能否为此建议最佳做法?
对于问题 2,我考虑将初始文件分解为一组子文件并并行处理它们。这可以通过引入一个新的“breaking”spout 来完成,其中每个文件都将由一个专用的 bolt 处理。在这种情况下,有保证的处理会引发大问题,因为如果出现错误,则必须完全重新处理包含失败行的子文件(喷口的确认/失败方法)...您能否提出最佳实践解决这个问题?
好的,到目前为止我做了什么。
先决条件
以下拓扑之所以有效,是因为它的所有部分(spouts 和 bolts)都是幂等的。
引入了一个单独的 spout,它读取文件行(一个接一个)并将它们发送到一个中间 ActiveMQ 队列('file-line-queue')以便能够轻松重放失败的文件行(参见下一步);
为“file-line-queue”队列创建了一个单独的 spout,它接收每个文件行并将其发送到后续的 bolts。就我使用有保证的消息处理而言,如果任何 bolt 失败,都会重新处理消息,如果 bolt 链成功,则会确认相应的消息(CLIENT_ACKNOWLEDGE 模式)。
如果第一个(文件读取)spout 失败,将抛出 RuntimeException,这会终止 spout。稍后,专门的主管会重新启动 spout,从而重新读取 inout 文件。这将导致重复的消息,但只要一切都是幂等的,这不是问题。此外,这里值得考虑一个状态存储库以减少重复...
新刊
为了使中间 JMS 更加可靠,我添加了一个异常监听器,用于为消费者和生产者恢复连接和 session 。问题出在消费者身上:如果 session 已恢复并且我在 bolt 处理过程中有一条 JMS 消息未被确认,在成功处理后我需要确认它,但就 session 是新的而言,我收到 '找不到相关 ID' 问题。
有人可以建议如何处理吗?
最佳答案
先回答你的问题:
让我们在这里谈谈设计。 Storm 是为流而不是批处理而构建的。在我看来,更适合批处理的 Hadoop 技术在这里会更好:MapReduce、Hive、Spark 等。
如果您打算使用 storm,那么它将有助于将数据流式传输到更容易使用的地方。您可以将文件写入 Kafka 或队列,以帮助解决管理状态、确认/失败和重试的问题。
关于java - Apache Storm : Make an Unscalable Resource Scalable,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/36035135/
在流处理方面,Apache Beam和Apache Kafka之间有什么区别? 我也试图掌握技术和程序上的差异。 请通过您的经验报告来帮助我理解。 最佳答案 Beam是一种API,它以一种统一的方式使
有点n00b的问题。 如果我使用 Apache Ignite 进行消息传递和事件处理,是否还需要使用 Kafka? 与 Ignite 相比,Kafka 基本上会给我哪些(如果有的话)额外功能? 提前致
Apache MetaModel 是一个数据访问框架,它为发现、探索和查询不同类型的数据源提供了一个通用接口(interface)。 Apache Drill 是一种无架构的 SQL 查询引擎,它通过
Tomcat是一个广泛使用的java web服务器,而Apache也是一个web服务器,它们在实际项目使用中有什么不同? 经过一些研究,我有了一个简单的想法,比如, Apache Tomcat Ja
既然简单地使用 Apache 就足以运行许多 Web 应用程序,那么人们何时以及为什么除了 Apache 之外还使用 Tomcat? 最佳答案 Apache Tomcat是一个网络服务器和 Java
我在某个 VPS( friend 的带 cPanel 的 apache 服务器)上有一个帐户,我在那里有一个 public_html 目录。我们有大约 5-6 个网站: /home/myusernam
我目前正在尝试将模块加载到 Apache,使用 cmake 构建。该模块称为 mod_mapcache。它已成功构建并正确安装在/usr/lib/apache2/modules directroy 中
我对 url 中的问号有疑问。 例如:我有 url test.com/controller/action/part_1%3Fpart_2 (其中 %3F 是 url 编码的问号),并使用此重写规则:R
在同一台机器上,Apache 在端口 80 上运行,Tomcat 在端口 8080 上运行。 Apache 包括 html;css;js;文件并调用 tomcat 服务。 基本上 exampledom
Apache 1 和 Apache 2 的分支有什么区别? 使用一种或另一种的优点和缺点? 似乎 Apache 2 的缺点之一是使用大量内存,但也许它处理请求的速度更快? 最有趣的是 Apache 作
实际上,我们正在使用 Apache 网络服务器来托管我们的 REST-API。 脚本是用 Lua 编写的,并使用 mod-lua 映射。 例如来自 httpd.conf 的实际片段: [...] Lu
我在 apache 上的 ubuntu 中有一个虚拟主机,这不是我的主要配置,我有另一个网页作为我的主要网页,所以我想使用虚拟主机在同一个 IP 上设置这个。 urologyexpert.mx 是我的
我使用 Apache camel 已经很长时间了,发现它是满足各种系统集成相关业务需求的绝佳解决方案。但是几年前我遇到了 Apache Nifi 解决方案。经过一番谷歌搜索后,我发现虽然 Nifi 可
由于两者都是一次处理事件的流框架,这两种技术/流框架之间的核心架构差异是什么? 此外,在哪些特定用例中,一个比另一个更合适? 最佳答案 正如您所提到的,两者都是实时内存计算的流式平台。但是当您仔细观察
apache 文件(如 httpd.conf 和虚拟主机)中使用的语言名称是什么,例如 # Ensure that Apache listens on port 80 Listen 80 D
作为我学习过程的一部分,我认为如果我扩展更多关于 apache 的知识会很好。我有几个问题,虽然我知道有些内容可能需要相当冗长的解释,但我希望您能提供一个概述,以便我知道去哪里寻找。 (最好引用 mo
关闭。这个问题是opinion-based .它目前不接受答案。 想改善这个问题吗?更新问题,以便可以通过 editing this post 用事实和引文回答问题. 4 个月前关闭。 Improve
就目前而言,这个问题不适合我们的问答形式。我们希望答案得到事实、引用或专业知识的支持,但这个问题可能会引起辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开,visit the he
这个问题在这里已经有了答案: Difference Between Apache Kafka and Camel (Broker vs Integration) (4 个回答) 3年前关闭。 据我所知
我有 2 个使用相同规则的子域,如下所示: RewriteEngine On RewriteCond %{REQUEST_FILENAME} !-f RewriteCond
我是一名优秀的程序员,十分优秀!