【发布时间】:2017-02-08 23:27:13
【问题描述】:
我正在努力学习火花。我有两个 RDD,格式如下:
RDD1
[["James Dean,1"], ["Roger Moore,2"]]
RDD2
[["22,1931,James Deen"], ["23,1927,Roger Moor"]]
现在 RDD2 中的数据可能拼写不正确。我想通过 RDD1,检查每个名称,然后在 RDD2 中查找所有相似的字符串并更正它们的拼写。我该怎么办? 我是 Spark 的新手,所以我完全迷路了。
【问题讨论】:
-
查找编辑距离。在尝试使用 Spark 之前,请先尝试在 Python(或 Scala)中解决这个问题。
标签: python apache-spark pyspark spark-dataframe rdd