【发布时间】:2018-07-30 21:37:11
【问题描述】:
我的 MongoDB 和 Spark 在 Zeppelin 上运行,它们共享同一个 HDFS。 MongoDB 生成存储在同一个 HDFS 中的 .wt 数据库。
我想将该 MongoDB 生成的数据库集合从 HDFS 加载到 Spark DataFrame 中。
是否可以直接从 HDFS 将数据库作为 DataFrame 加载到 spark 中?还是我需要使用 MongoDB Spark 连接器?
【问题讨论】:
-
stackoverflow.com/questions/25203325/… 可能是一个很好的起点。
-
什么是磁盘格式?当然,只要有足够的编码和足够的内存,这绝对是可能的。
-
DataFrame df = sqlContext.read.format("com.stratio.datasource.mongodb").options(options).load
-
@thebluephantom 您能否进一步详细说明您的代码
-
他没有问操作系统,他问的是数据的格式。您需要确定 Spark 是否可以读取
wt格式的文件。
标签: mongodb apache-spark hadoop hdfs