【问题标题】:how could I merge the column that was duplicated in pyspark? [duplicate]如何合并在 pyspark 中重复的列? [复制]
【发布时间】:2020-03-26 11:10:26
【问题描述】:

我有一个如下的数据框:

+--------------------+--------------------+
|                 _id|           statement|
+--------------------+--------------------+
|                   1|            ssssssss|
|                   2|            ssssssss|
|                   3|            aaaaaaaa|
|                   4|            aaaaaaaa|
+--------------------+--------------------+

使用 df.dropDuplicates(['statement']) 后,我得到了这个:

+--------------------+--------------------+
|                 _id|           statement|
+--------------------+--------------------+
|                   1|            ssssssss|
|                   3|            aaaaaaaa|
+--------------------+--------------------+

但实际上,我想保持 _id 值如下:

+--------------------+--------------------+
|                 _id|           statement|
+--------------------+--------------------+
|                1, 2|            ssssssss|
|                3, 4|            aaaaaaaa|
+--------------------+--------------------+

我该怎么办?

【问题讨论】:

    标签: pyspark merge


    【解决方案1】:

    终于在combine text from multiple rows in pyspark找到我的答案

    sdf.groupBy('lstatement').agg(F.collect_list('_id').alias("_id")).show()
    

    【讨论】:

      猜你喜欢
      • 2021-09-02
      • 1970-01-01
      • 2018-10-28
      • 2018-04-02
      • 2020-12-08
      • 1970-01-01
      • 2020-11-29
      • 2020-08-19
      • 2016-05-02
      相关资源
      最近更新 更多