【发布时间】:2015-05-28 00:50:55
【问题描述】:
我在 hdfs 集群上有(表格)数据,需要对其进行一些稍微复杂的查询。我预计未来会多次面对同样的情况,还有其他数据。所以,问题:
在执行此类任务时,选择在哪里使用(纯)Spark 以及在哪里使用 Spark-SQL 需要考虑哪些因素?
这是我能想到的选择因素:
熟悉语言: 就我而言,我更像是一名数据分析师,而不是一名数据库专家,因此这将引导我使用 spark:我更愿意考虑如何(有效地)在 Java/Scala 中实现数据选择,而不是在 SQL 中。然而,这主要取决于查询。
序列化: 我认为一个人可以运行 Spark-SQL 查询,而无需将自制的 jar+dep 发送给 spark 工作者(?)。但是,返回的数据是原始数据,应该在本地进行转换。
效率: 我不知道两者之间有什么区别。
我知道这个问题对于 SO 来说可能过于笼统,但也许不是。那么,有更多知识的人可以提供一些见解吗?
【问题讨论】:
标签: hadoop apache-spark apache-spark-sql