【发布时间】:2015-03-11 21:32:35
【问题描述】:
我是 Apache Spark 的新手,想获取保存在 JSON 中的数据集(字典列表),将其加载到 RDD 中,然后应用过滤器和映射等操作。在我看来,这应该很简单,但是在查看 Spark 的文档后,我发现唯一使用 SQL 查询 (https://spark.apache.org/docs/1.1.0/sql-programming-guide.html),这不是我想要与 RDD 交互的方式。
如何将保存在 JSON 中的数据集加载到 RDD 中?如果我错过了相关文档,我将不胜感激。
谢谢!
【问题讨论】:
-
同一文档说使用 SQL 只是一种选择:您可以使用 jsonRDD 以分层方式查询数据。
val anotherPeopleRDD = sc.parallelize( """{"name":"Yin","address":{"city":"Columbus","state":"Ohio"}}""" :: Nil); val anotherPeople = sqlContext.jsonRDD(anotherPeopleRDD)
标签: python json apache-spark