【发布时间】:2018-05-15 05:31:08
【问题描述】:
我有一个以下格式的数据框
Col-1Col-2
a d1
a d2
x d3
a d4
f d5
a d6
a d7
我想通过查看 col1 中的连续重复项来合并 col-2 中的值。我们可以看到 a 出现了两次连续重复项。它应该分别合并 d1+d2 和 d6+d7。这些列的数据类型是字符串,d1+d2 表示将字符串 d1 与 d2 连接
最终的输出应该如下图所示
Col-1Col-2
a d1+d2
x d3
a d4
f d5
a d6+d7
【问题讨论】:
-
你的行的数据类型是什么?它们是字符串吗?数字?
+在d1+d2中是什么意思? -
数据类型是字符串。 + 表示简单连接 .d1+d2 是将字符串 d1 与 d2 连接
-
您可能需要预先添加另一列来指示上一行是否重复。据我了解,在执行某些操作后,您不太可能在 RDD 中保留顺序。见here。
标签: python apache-spark pyspark apache-spark-sql