【问题标题】:Spark - Scala - Join RDDS (csv) filesSpark - Scala - 加入 RDDS (csv) 文件
【发布时间】:2015-12-16 18:18:50
【问题描述】:

我正在学习 scala,因为我在最初的步骤中,出现了需求并且需要知道如何加入两个领域,例如关系数据库。

例子:

表 1 (csv)

zip_type、primary_city、acceptable_cities、unacceptable_cities

例子:

表 2 (csv)

GEO.id, GEO.id2, GEO.display-label, VD01

问题:

我想将 Column1(zip 类型)Table1 与 Column2(GEO.id2)Table2 连接起来。

目前我:

  • 用我的 CSV 文件创建了一个 RDD
  • 使用 CSV 解析器处理每一行,但我在进行连接时遇到了一些麻烦。

接下来我需要做什么?

【问题讨论】:

    标签: scala csv apache-spark


    【解决方案1】:

    要加入,您需要具有相同键列的 pair-rdds。 考虑将 RDD-1 转换为以 zip-type 为键的元组 (K, V) 的 RDD,类似于以 GEO.id2 为键的 RDD-2。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2018-04-15
      • 2017-03-31
      • 2016-03-25
      • 2018-04-26
      • 2014-03-18
      • 2018-03-11
      • 2015-12-04
      相关资源
      最近更新 更多