【发布时间】:2021-07-23 04:42:14
【问题描述】:
root
|-- cores: long (nullable = true)
|-- time0: double (nullable = true)
|-- time1: double (nullable = true)
|-- time2: double (nullable = true)
+-----+------------------+------------------+-----------------+
|cores|time0 |time1 |time2 |
+-----+------------------+------------------+-----------------+
|1 |26.362340927124023|25.891045093536377|26.19786810874939|
|2 |28.445404767990112|32.81148290634155 |30.37511706352234|
|4 |29.17068886756897 |28.47817611694336 |29.78126311302185|
+-----+------------------+------------------+-----------------+
我想要包含平均值和标准偏差列的结果数据框。
df_mean_stddev = df_cores.withColumn('*', F.mean(array(df_cores.columns[1:])).alias('mean'))
.withColumn(stddev(array(df_cores.columns[1:])).alias('stddev'))
df_mean_stddev.printSchema()
df_cores.show(truncate=False)
我尝试了上述方法,但我得到了错误。没有一个例子对我来说似乎工作正常,按行引用多个聚合。我是 PySpark 的新手。
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql mean standard-deviation