【发布时间】:2018-05-01 01:42:23
【问题描述】:
我正在处理结构化数据(每个字段一个值,每行相同的字段),我必须将其放入带有 Spark(作为分析工具)和 Hadoop 的 NoSql 环境中。不过,我想知道使用什么格式。我在考虑 json 或 csv 但我不确定。你怎么看,为什么?我在这个领域没有足够的经验来做出正确的决定。
第二个问题:我必须分析这些数据(存储在 HDFS 中)。所以,据我所知,我有两种查询它们的可能性(在分析之前):
-
直接读取和过滤。我的意思是它可以用 Spark 来完成,例如:
data = sqlCtxt.read.json(path_data) 使用 Hbase/Hive 正确进行查询,然后处理数据。
所以,我不知道做这一切的标准方法是什么,最重要的是,什么是最快的。 提前谢谢你!
【问题讨论】:
-
“最快”选项是使用 Hbase(取决于数据模型),或者使用其他数据库,而不是 Hadoop 来从磁盘读取原始数据(所以也不是 Hive)
标签: hadoop apache-spark hive hbase dataformat