【发布时间】:2015-09-02 18:28:14
【问题描述】:
我正在处理需要存储中间结果以便在下一个窗口流中重用它们的 spark 流式传输作业。数据数量非常大,因此可能无法将其存储在 Spark 缓存中。我还需要以某种方式通过某些“键”读取数据。 我曾考虑将 Cassandra 作为中间存储,但它也有一些缺点。 或者,也许 Kafka 可以完成这项工作,但它需要额外的工作才能通过键选择给定的数据部分。
你能告诉我我应该怎么做吗? Storm 中如何解决此类问题 - 是否有任何内部机制,或者最好使用一些外部工具?
【问题讨论】:
-
您的意思是输入 s/Wow/how 吗?
-
@phact 是的,已编辑 - 谢谢
-
在 Storm 中,您必须将中间结果保存在内存中(或将它们保存到数据库中)。哦,你必须实现逻辑来处理你的设计决策。
标签: cassandra bigdata spark-streaming apache-storm