【发布时间】:2020-09-02 09:01:11
【问题描述】:
我有一个稀疏填充的表,其中包含唯一用户 ID 的各个段的值。我只需要创建一个包含 unique_id 和相关段标头的数组
请注意,这只是一个指示性数据集。我有数百个这样的片段。
------------------------------------------------
| user_id | seg1 | seg2 | seg3 | seg4 | seg5 |
------------------------------------------------
| 100 | M | null| 25 | null| 30 |
| 200 | null| null| 43 | null| 250 |
| 300 | F | 3000| null| 74 | null|
------------------------------------------------
我希望输出是
-------------------------------
| user_id| segment_array |
-------------------------------
| 100 | [seg1, seg3, seg5] |
| 200 | [seg3, seg5] |
| 300 | [seg1, seg2, seg4] |
-------------------------------
pyspark-sql 的 pyspark 中是否有可用的函数来完成此任务?
感谢您的帮助!
【问题讨论】:
标签: arraylist pyspark apache-spark-sql record