【发布时间】:2019-06-21 17:00:56
【问题描述】:
我已经阅读了很多有关 hadoop 集群以及将我们的关系数据存储到 hadoop 中的不同选项的信息,因此我们可以为我们的关系和非关系数据建立一个集中的数据集群以进行分析。 但随着我阅读的更多,它变得更加复杂。 我不知道将我的关系数据转换为 hadoop 的最佳方法是什么。
- 将它们存储在 HBase 的大表中(我认为将所有表连接起来会很丑)
- 将它们存储在 Hive 的不同表中?
- 还有其他选择吗?
我在想我可以将每个表存储在 Hive 中,然后使用 SPARK SQL 执行查询。不知道是不是最好的选择? 任何人都可以帮我一点吗?
【问题讨论】:
-
Hive 有自己的查询语言;你可以使用它,一切都应该非常简单。
-
@BenWatson 是的,但是由于所有磁盘处理,它非常慢。这就是为什么我想使用 Spark 让它更快。
-
无论您使用什么解决方案,都必须在某个时候将数据加载到内存中。想要最大限度地减少这种情况完全取决于您对数据运行的查询类型,并且对于 SO 的范围来说可能太大了。
-
是的,但是 Hive 将中间结果存储在磁盘中,这使得它具有容错性并且速度也很慢。
-
这就是为什么我说不知道具体用例就不可能回答你的问题。
标签: apache-spark hadoop hive hbase relational-database