【问题标题】:Why would I use Spark instead of Java to process data from cassandra?为什么我要使用 Spark 而不是 Java 来处理来自 cassandra 的数据?
【发布时间】:2017-04-17 20:06:57
【问题描述】:

如果我必须处理 1000 万条记录并在其中一列中搜索字符串匹配,我可以使用 java.util.

在 spark 中我比 java 有什么优势?

【问题讨论】:

  • 对于初学者来说,Spark 是分布式的。如果您只有一个单线程 Java 或 Spark 节点,那么几乎没有区别。
  • 谢谢。为什么投反对票?
  • 没有投反对票,但问题可能缺少研究工作。
  • 不要假设懒惰,这可能是缺乏理解力。我确实试图找出答案,浏览了很多文档,详细说明了如何做某事,但找不到原因。如果您有链接分享将不胜感激。
  • 假设留给读者。随意edit您的问题与您参考/尝试过的事情

标签: java apache-spark cassandra


【解决方案1】:

当然你可以用java编写一个程序,并使用它的并发框架来实现并行。

但是,想一想,对于您提到的示例,仅 Cassandra API 就足够了!!!为什么选择 Java?

Cassandra 是一种可靠的分布式数据存储。它提供了一些数据处理能力,但不够灵活。所以我们考虑使用通过其他编程语言公开的 API,例如 - java。

现在,问题归结为 Java 与 Spark?我能想到的最简单的答案是,如果您确定单个 JVM 足以满足处理要求,请选择 Java,否则请考虑 Spark 或其他分布式处理框架,如 flink 等。

【讨论】:

    猜你喜欢
    • 2017-05-24
    • 2012-11-05
    • 2018-03-29
    • 2017-11-06
    • 2010-11-18
    • 2016-02-05
    • 2015-07-22
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多