【问题标题】:Storm framework applicationsStorm 框架应用
【发布时间】:2015-10-07 11:12:56
【问题描述】:

我使用 Hadoop 构建了一个用于在分布式环境中搜索类似图像存储的应用程序。但是Hadoop不支持实时处理,所以响应时间长。我知道Storm是大数据分析应用的另一个框架。但是我很困惑我们是否可以使用 Storm 来实现这种应用程序。

有没有人建议什么样的应用程序可以有效地使用 Storm 框架。

【问题讨论】:

    标签: hadoop apache-spark apache-storm spark-streaming apache-samza


    【解决方案1】:

    Storm 是一个非常可扩展、快速、容错的分布式计算开源系统,特别关注流处理。 Storm 擅长事件处理和增量计算,可以根据数据流实时计算滚动指标

    事件流处理是 Storm 的主要优势。

    通常 Hadoop 用于批处理。但 Storm 是实时处理的 Hadoop,而 Spark 是内存数据存储的分布式处理

    看看这个Storm and SparkStack Comparison 链接

    编辑:

    我对这个问题的解决方案

    1) 将图像存储在 CMS(内容管理系统)中,CDN 分布在多个网络中,而不是 HDFSNoSQL 数据库中)

    2) 将Image Id、Image Name、MD5SUM、Image Location元信息存储在HBase表中

    3) 使用 Spark 和 HBase 进行图像数据处理,例如通过检查 MD5SUM

    删除重复的图像

    【讨论】:

    • 感谢您的回答和出色的链接!我仍然无法确定 Storm 是否适合搜索存储在分布式计算机中的图像的相似图像任务?
    • 我也是。我更喜欢 Spark 而不是 Storm。
    • 免责声明:我是 Apache Flink 的提交者 你也可以考虑flink.apache.org 与 Spark 相比,它提供了类似于 Storm 的真正流式传输(并且没有像Spark 可以)而 Flink 也可以处理批处理作业。比较:stackoverflow.com/questions/28082581/…stackoverflow.com/questions/30699119/…
    • @Matthias J. Sax 和 ravindra:谢谢你们的回答。所以我真的很困惑,我目前的搜索问题实现是基于 Hadoop 的批处理,所以我是否可以使用 Flink ot Storm 像一个可替换的解决方案来将这个问题转移到流处理中
    • 这取决于您和您的组织的舒适度、交付的紧迫性和赞助以转移到不同的技术等。如果没有任何可能,您将继续保持现状(hadoop 批处理延迟处理)
    猜你喜欢
    • 2018-10-13
    • 2016-11-08
    • 2015-03-13
    • 1970-01-01
    • 2016-11-13
    • 1970-01-01
    • 1970-01-01
    • 2011-02-20
    • 1970-01-01
    相关资源
    最近更新 更多