【发布时间】:2021-07-13 23:36:14
【问题描述】:
可以帮助我解决用例: 下面是数据集
+-----------+-------------+------------+
|artistId |musicalGroups|displayName |
+-----------+-------------+------------+
|wa_16 |wa_31 |Exods |
|wa_38 |wa_16 |Kirk |
+-----------+-------------+------------+
我想根据 musicalGroups 值填充列 name,并根据 artistId 设置 name strong> displayName 列值。 就像在下面的示例中,我们将 wa_16 作为名为 Exods 的艺术家 ID,因此 name 列应该具有根据它的艺术家 ID 的 displayName。 示例:
+-----------+-------------+------------+
|artistId |musicalGroups|displayName |name
+-----------+-------------+------------+
|wa_16 |wa_31 |Exods |null
|wa_38 |wa_16 |Kirk |Exods
+-----------+-------------+------------+
Tried via self join on artistId and musicalGroups, but it was not working.
Can some help me to solve this usecase?
【问题讨论】:
-
请检查并告诉我们以下代码是否适合您
标签: scala apache-spark apache-spark-sql