【问题标题】:scala RDD dataprocessscala RDD 数据处理
【发布时间】:2017-03-30 06:28:19
【问题描述】:

这是我的代码:

val data = Array("eq_len Alice@TF [11.5, 11.8, 12.0, 12.3, 12.56, 12.79, 13.01, 16.85] 639684 16.4 11.565149",
                 "eq_len Bob@TY [0.0, 2.4, 4.8, 7.2, 9.6, 12.0, 14.4, 16.8] 604804 48.0 0.0",
                 "eq_len Cool@GF [11.4, 12.35, 13.3, 14.25, 15.2, 16.15, 17.1, 18.05] 639677 0.184546 0.003718",
                 "eq_len Gop@FF [ 7.6, 8.55, 9.5, 10.45, 13.2, 13.9, 14.6, 15.3] 629981 0.585282 0.000504")
val sc = prepareConfig();
val baseRDD = sc.parallelize(data)

我想要这个结果:

Alice,11.5, 11.8, 12.0, 12.3, 12.56, 12.79, 13.01, 16.85
Bob,0.0, 2.4, 4.8, 7.2, 9.6, 12.0, 14.4, 16.8
Cool,11.4, 12.35, 13.3, 14.25, 15.2, 16.15, 17.1, 18.05
Gop,7.6, 8.55, 9.5, 10.45, 13.2, 13.9, 14.6, 15.3

谢谢。

【问题讨论】:

  • 所以您的问题与您之前问过的问题不同stackoverflow.com/q/40605461/3415409 怎么样?请在您的问题上付出一些努力,并阅读有关如何在 SO 上提问的信息!这不是一个家庭作业平台

标签: scala apache-spark rdd


【解决方案1】:

这是我的代码:

val rdds = sc.textFile(filename)

val sets = rdds.map{
  line => val splt = line.split("\t")
    val spltflag = "\\w+".r
    val id = spltflag findFirstIn splt(1) match {
      case Some(y) => y
    }
    (id,splt(2))
}

【讨论】:

  • 编辑问题,不要添加这个(非)答案。正如@eliasah 所说,在此处阅读有关如何提问的一些(相当不错的)帮助
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-05-30
  • 2016-11-04
  • 2017-01-24
  • 2016-05-06
  • 1970-01-01
  • 2018-04-30
相关资源
最近更新 更多