【发布时间】:2022-01-15 09:33:36
【问题描述】:
我目前在 google colab notebook 中使用 pyspark,在进行了一些数据清理之后,我完成了一个数据框,该数据框具有: 参数代码;县名;每天的算术平均值
我需要一个表格,为每个参数提供具有最高值和最低值的县的名称
在完成这个 groupby 之后,我最终得到了我想要的(每个参数代码和县名都有最大值的值)但只有最大值,我还需要最小值
county_param_value_small_grouped_parameter_code = county_param_value_small.groupby('parameter_code','county_name').max('arithmetic_mean').orderBy("parameter_code","max(arithmetic_mean)",ascending=False).show(10)
我想最终得到一个表格,其中包含 2 个县名和每个参数代码的 2 个值,分别是最高值和最低值。 但是我在操作它时遇到了很多麻烦,因为它总是返回一个对象,我必须一次性完成所有条件并最终有一个 .show() 。
【问题讨论】:
-
您是否只想将
min的arithmetic_mean添加到您当前的结果中?您能否以纯文本形式提供一些示例数据和示例数据的预期结果? -
决赛桌应该是这样的 parameter_code |县名 |价值 88136 |马宏宁 | 0.909 88136 |东巴吞鲁日 | 0.0847 89463 |加尔维斯顿 | 0.893 89463 |道格拉斯 | 0.002 (...) (...) (...) 因为我想显示哪些县的空气质量最好/最差? (并考虑污染物的水平对县进行排名!)这就是为什么我需要为每个污染物水平设置两个行,我还试图获得一个具有最大值的表和一个具有最小值的表并以某种方式进行连接,但也很难弄清楚这一点出编辑:我认为当我换行时编辑器不接受它
-
不要发布表格,代码,只需将其复制并粘贴为字符串。
标签: python apache-spark pyspark apache-spark-sql