【发布时间】:2018-06-18 18:36:24
【问题描述】:
我对 Spark 很陌生。我有一个输入 json 文件,我正在阅读它
val df = spark.read.json("/Users/user/Desktop/resource.json");
resource.json 的内容如下:
{"path":"path1","key":"key1","region":"region1"}
{"path":"path112","key":"key1","region":"region1"}
{"path":"path22","key":"key2","region":"region1"}
有什么方法可以处理这个数据框并将结果聚合为
Map<key, List<data>>
其中 data 是每个存在 key 的 json 对象。
例如:预期结果是
Map<key1 =[{"path":"path1","key":"key1","region":"region1"}, {"path":"path112","key":"key1","region":"region1"}] ,
key2 = [{"path":"path22","key":"key2","region":"region1"}]>
任何进一步进行的参考/文档/链接都会有很大帮助。
谢谢。
【问题讨论】:
-
你可以在scala中使用groupBy。
标签: scala apache-spark bigdata