【发布时间】:2019-05-07 11:25:46
【问题描述】:
我有一个遵循以下结构的 Spark 数据框:
+------+-----------+-----------+-----------+------+
|ID | Name1 | Name2 | Name3 | Y |
+------+-----------+-----------+-----------+------+
| 1 | A,1 | B,1 | C,4 | B |
| 2 | D,2 | E,2 | F,8 | D |
| 3 | G,5 | H,2 | I,3 | H |
+------+-----------+-----------+-----------+------+
对于我想查找的每一行,Y 的值在哪一列中表示为第一个元素。所以,理想情况下,我想检索如下列表:[Name2,Name1,Name2]。
我不确定首先转换为 RDD,然后使用 map 函数并将结果转换回 DataFrame 如何以及是否有效。
欢迎提出任何想法。
【问题讨论】:
-
Name1,Name2和Name3的类型是什么? -
列名是直截了当的字符串。
标签: python apache-spark pyspark