【发布时间】:2021-10-05 21:26:55
【问题描述】:
我正在努力从预聚合帧中输出总的去重计数,如下所示。
我目前有一个这样显示的数据框。这是我通过过滤掉不需要的列而得到的初始结构和要点。
| ID | Source |
|---|---|
| 101 | Grape |
| 101 | Flower |
| 102 | Bee |
| 103 | Peach |
| 105 | Flower |
我们可以从上面的示例中看到,在 Grape 和 Flower 中都可以找到 101。我想安排格式,以便“源”列中的不同字符串值成为它们自己的源,因为从那里我可以执行 groupBy 来进行特定的 yes 和 no 的排列。
| ID | Grape | Flower | Bee | Peach |
|---|---|---|---|---|
| 101 | Yes | Yes | No | No |
| 102 | No | No | Yes | No |
| 103 | No | No | No | Yes |
我同意通过上面的示例手动创建它是一个不错的选择,但我正在处理 +100m 行并且需要更合适的东西。
到目前为止,我提取的是一个不同 Source 值的列表,并将它们排列成一个列表:
dedupeTableColumnNames = dedupeTable.select('SOURCE').distinct().collect()
dedupeTableColumnNamesCleaned = re.findall(r"'([^']*)'", str(dedupeTableColumnNames))
【问题讨论】:
标签: pyspark