【发布时间】:2015-10-07 18:32:02
【问题描述】:
我试图弄清楚如何使用 Spark 最好地存储和检索从 S3 到 Cassandra 的数据:我有存储在 Cassandra 中的日志数据。我使用 DSE 运行 Spark 来执行数据分析,它运行良好。日志数据每天都在增长,在任何给定时间我只需要在 Cassandra 中使用两周的时间。我仍然需要将旧日志存储在某个地方至少 6 个月,经过研究,带有 Glaciar 的 S3 看起来是最有希望的解决方案。我想使用 Spark 来运行一项日常工作,从第 15 天开始查找日志,将它们从 Cassandra 中删除,然后将它们发送到 S3。我的问题是:我似乎无法确定正确的格式来将 Cassandra 行保存到文件中,以便有一天我可以将文件重新加载到 Spark 中,并在必要时运行分析。我只想有一天在 Spark 中运行分析,而不是将数据保存回 Cassandra。 JSON 似乎是一个明显的解决方案,但还有其他我不考虑的格式吗?我应该使用 Spark SQL 吗?在我承诺一种或另一种格式之前,任何建议都会受到赞赏。
【问题讨论】:
标签: amazon-s3 cassandra apache-spark datastax-enterprise apache-spark-sql