【问题标题】:Sum columns of a dataset对数据集的列求和
【发布时间】:2022-07-19 05:17:02
【问题描述】:

我在 PySpark 工作,我有一个这样的数据集:

我想用相应的总和创建一个像这样的新df:

所以我尝试了这段代码:


    df = df.withColumnRenamed("month_actual_january", "monthjanuary")
    fin=df.groupBy(["column1","column2"]).sum()

问题是我收到以下错误:

Attribute sum(column3) contains an invalid character among ,;{}()\n\t=. Please use an alias to rename it

你知道如何解决这个错误吗?谢谢!

【问题讨论】:

标签: pyspark


【解决方案1】:

让我们尝试使用最小二乘法来传递通配符别名,如下所示

   df.groupBy(["column1","column2"]).agg(*[sum(x).alias(f"sum_{x}") for x in df.drop('customerId').columns]).show()

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-11-30
    • 1970-01-01
    • 2019-03-12
    • 2016-01-27
    • 2016-11-01
    • 1970-01-01
    • 2019-03-30
    相关资源
    最近更新 更多