【发布时间】:2016-02-24 13:23:53
【问题描述】:
我有一个“半结构化”的 csv 文件
canal,username,email,age
facebook,pepe22,anyemail@gmail.com,24
twitter,foo-24,anyemail@gmail.com,33
facebook,caty24,,22
假设我希望将第一列第二列和第三列放入 RDD org.apache.spark.rdd.RDD[(String, String, String)]
我是新人,我用的是 spark 1.4.1,我的代码到这里
val rdd = sc.textFile("/user/ergorenova/socialmedia/allus/test").map(_.split(","))
有人可以帮我吗?
我会很感激的
【问题讨论】:
标签: scala apache-spark