【发布时间】:2019-01-11 07:09:33
【问题描述】:
我有一个 PySpark 数据框,其中有一列包含逗号分隔值。该列包含的值的数量是固定的(例如 4)。 示例:
+----+----------------------+
|col1| col2|
+----+----------------------+
| 1|val1, val2, val3, val4|
| 2|val1, val2, val3, val4|
| 3|val1, val2, val3, val4|
| 4|val1, val2, val3, val4|
+----+----------------------+
这里我想将 col2 分成 4 个单独的列,如下所示:
+----+-------+-------+-------+-------+
|col1| col21| col22| col23| col24|
+----+-------+-------+-------+-------+
| 1| val1| val2| val3| val4|
| 2| val1| val2| val3| val4|
| 3| val1| val2| val3| val4|
| 4| val1| val2| val3| val4|
+----+-------+-------+-------+-------+
如何做到这一点?
【问题讨论】:
-
我在链接的副本上发布了an answer,显示了如何在不使用
udf或collect的情况下针对一般情况执行此操作。