【发布时间】:2015-12-08 10:26:47
【问题描述】:
我开始学习大数据和Apache Spark,我有一个疑问。
将来我需要从物联网收集数据,这些数据将以time series data 的形式提供给我。我正在阅读有关时间序列数据库 (TSDB) 的文章,我发现了一些开源选项,例如 Atlas、KairosDB、OpenTSDB 等。
我实际上需要 Apache Spark,所以我想知道:我可以在 Apache Spark 上使用时序数据库吗?这有什么意义吗?请记住,我对大数据、Apache Spark 以及我在这个问题中谈到的所有问题的概念都很陌生。
如果我可以在 Spark 上运行 TSDB,我该如何实现?
【问题讨论】:
-
你应该可以,看看spark.apache.org/docs/latest/api/scala/… 和github.com/databricks/spark-csv/blob/master/src/main/scala/com/… 之类的实现——我还没有找到任何OpenTSDB Java API,所以你可能需要去挖掘。跨度>
-
这是一个有趣的话题,但是
TSDB over Spark是什么意思?传感器数据处理的哪一部分需要在数据库中执行,在 Spark 中执行哪一部分? -
我需要将所有时间序列存储在一个好的数据库中,然后我需要 Spark 使用它的机器学习算法来处理这些数据。
-
@FernandoPaladini 应该没问题,Spark可以充当客户端,例如通过 JDBC 执行 REST 查询或 SQL 查询?
-
@SergeiRodionov 我认为真正的问题是,如果您通过 REST API 或 SQL 查询加载数据,它将在驱动程序进程中加载。数据不会被分布式加载。
标签: database apache-spark time-series bigdata