【问题标题】:percentage count per group and pivot with pyspark每组的百分比计数和使用 pyspark 的枢轴
【发布时间】:2017-04-09 21:40:29
【问题描述】:

我有包含 from 和 to 列的数据框。两者都是国家代码,它们显示起始国家和目的地国家。

+----+---+
|from| to|
+----+---+
|  TR| tr|
|  TR| tr|
|  TR| tr|
|  TR| gr|
|  ES| tr|
|  GR| tr|
|  CZ| it|
|  LU| it|
|  AR| it|
|  DE| it|
|  IT| it|
|  IT| it|
|  US| it|
|  GR| fr|

有没有办法获得一个数据框,该数据框显示每个目的地国家/地区的百分比,以及所有目的地国家/地区代码的列?

该百分比必须在同一原产国(行)的目的地总数中。

例如

+----+---+----+---+----+
|from| tr|  it| fr|  gr|
+----+---+----+---+----+
|  TR|0.6|0.12|0.2|0.09|
|  IT|0.3| 0.3|0.3| 0.8|
|  US|0.1|0.34|0.3| 0.2|

【问题讨论】:

    标签: sql apache-spark pyspark jupyter-notebook


    【解决方案1】:

    您可以pivotcount 并调整结果。首先是一些导入:

    from pyspark.sql.functions import col, lit, coalesce
    from itertools import chain
    

    查找级别:

    levels = [x for x in chain(*df.select("to").distinct().collect())]
    

    pivot:

    pivoted = df.groupBy("from").pivot("to", levels).count()
    

    compute行计数表达式:

    row_count = sum(coalesce(col(x), lit(0)) for x in levels)
    

    创建调整列的列表:

    adjusted = [(col(c) / row_count).alias(c) for c in levels]
    

    select:

    pivoted.select(col("from"), *adjusted)
    

    【讨论】:

      猜你喜欢
      • 2018-05-06
      • 1970-01-01
      • 2022-08-23
      • 2017-10-13
      • 1970-01-01
      • 1970-01-01
      • 2017-11-12
      • 2021-03-18
      • 1970-01-01
      相关资源
      最近更新 更多