【发布时间】:2023-03-31 05:06:01
【问题描述】:
有没有办法使用 spark sql 根据列的分布来选择随机样本?例如对于下面的数据框,我想选择总共 6 行但大约 2 行 prod_name = A 和 2 行 prod_name = B 和 2 行 prod_name = C ,因为它们各占 1/3数据?请注意,每种产品并不总是占 1/3%。这只是一个例子。非常感谢您的帮助。
prod_name | value
----------------------
A | 100
A | 200.
A | 300
A | 400
B | 500
B | 600
B | 650
B | 700
C | 500
C | 600
C | 650
C | 700
【问题讨论】:
标签: python dataframe apache-spark pyspark apache-spark-sql