【发布时间】:2018-07-20 20:39:56
【问题描述】:
我正在使用 pyspark 版本 1.5.2。我有一个带有“id”列的 pyspark dataframe,如下所示:
id
------------
000001_128
000123_1_3
006745_8
000000_9_7
我想计算 DF 每一行中 '_'(下划线)的数量并执行 when 操作,如果字符串中只有 1 个下划线,我想添加 '_1' 作为后缀,否则保持原样。所以想要的结果是:
id | new_id
------------------------
000001_128 | 000001_128_1
000123_1_3 | 000123_1_3
006745_8 | 006745_8_1
000000_9_7 | 000000_9_7
我正在使用 pyspark.sql.functions 进行其他操作。
感谢任何帮助!
【问题讨论】:
标签: python dataframe pyspark apache-spark-sql pyspark-sql