【发布时间】:2021-03-02 17:24:54
【问题描述】:
我正在使用 pyspark 3.0.1。我有一个学生数据框df。数据框看起来像
MathsMarks HistoryMarks id class TotalMarks
80 75 1 9 300
90 78 1 9 350
65 70 7 8 250
58 55 7 8 200
75 72 7 8 260
85 82 9 9 400
82 85 15 8 410
如果id & class 组合重复多次,我需要从数据中随机选择一条记录。
例如,我的结果可能看起来像
MathsMarks HistoryMarks id class TotalMarks
80 75 1 9 300
58 55 7 8 200
85 82 9 9 400
82 85 15 8 410
你能建议我怎么做吗? 在实施@mck 的步骤后,当它们不在连续行中时,我会得到重复。例如
Group MathsMarks HistoryMarks id class TotalMarks
A 80 75 1 9 300
A 90 78 1 null 350
A 70 78 1 9 320
B 65 70 7 8 250
B 58 55 8 null 240
B 65 70 7 8 250
B 58 55 8 null 200
C 85 82 9 9 400
D 82 85 15 8 410
我希望通过以下方式
Group MathsMarks HistoryMarks id class TotalMarks
A 80 75 1 9 300
A 90 78 1 null 350
B 65 70 7 8 250
B 58 55 8 null 240
C 85 82 9 9 400
D 82 85 15 8 410
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql