【问题标题】:Pyspark : how to code complicated dataframe calculation lead sumPyspark:如何编写复杂的数据帧计算引导和
【发布时间】:2020-08-07 20:01:45
【问题描述】:

我给出的数据框看起来像这样。 此数据框按日期排序,col1 只是一些随机值。

    TEST_schema = StructType([StructField("date", StringType(), True),\
                              StructField("col1", IntegerType(), True),\
                             ])
    TEST_data = [('2020-08-01',3),('2020-08-02',1),('2020-08-03',-1),('2020-08-04',-1),('2020-08-05',3),\
                 ('2020-08-06',-1),('2020-08-07',6),('2020-08-08',4),('2020-08-09',5)]
    rdd3 = sc.parallelize(TEST_data)
    TEST_df = sqlContext.createDataFrame(TEST_data, TEST_schema)
    TEST_df.show() 
    
+----------+----+
|      date|col1|
+----------+----+
|2020-08-01|   3|
|2020-08-02|   1|
|2020-08-03|  -1|
|2020-08-04|  -1|
|2020-08-05|   3|
|2020-08-06|  -1|
|2020-08-07|   6|
|2020-08-08|   4|
|2020-08-09|   5|
+----------+----+

LOGIC : Lead(col1) +1,如果 col1 ==-1,则从前一个值开始 Lead(col1) +2...
结果数据框将如下所示(想要的列是我想要的输出)

+----------+----+----+
|      date|col1|WANT|
+----------+----+----+
|2020-08-01|   3|   2|
|2020-08-02|   1|   6|
|2020-08-03|  -1|   5|
|2020-08-04|  -1|   4|
|2020-08-05|   3|   8|
|2020-08-06|  -1|   7|
|2020-08-07|   6|   5|
|2020-08-08|   4|   6|
|2020-08-09|   5|  -1|
+----------+----+----+

让我们看看最后一行,其中 col1==5,5 前导 +1,即 want==6 (2020-08-08) 如果我们有 col==-1,那么我们再添加 +1,如果我们有 col==-1 重复两次,那么我们再添加 +2.. 这很难用语言来解释,最后因为它创建了最后一列而不是 null,所以用 -1 替换。我有一个图表

【问题讨论】:

    标签: pyspark apache-spark-sql pyspark-dataframes


    【解决方案1】:

    您可以检查以下代码和逻辑是否适合您:

    1. 创建一个子组标签 g,它的运行总和为 int(col1!=-1),我们只关注 col1 == -1 的 Rows,并取消所有其他 Rows。
    2. 残差为 1,如果 col1 == -1,加上 Window w2 上的运行计数
    3. 将 prev_col1 放在不是 -1 的 w1 上(使用 nullif),(prev_col1 的命名可能会造成混淆,因为只有当 col1 = -1 时才需要使用典型 pyspark 的方式进行填充,否则保留原创)。
    4. 设置 val = prev_col1 + 残差,取滞后并将 null 设置为 -1

    代码如下:

    from pyspark.sql.functions import when, col, expr, count, desc, lag, coalesce    
    from pyspark.sql import Window
    
    w1 = Window.orderBy(desc('date'))
    w2 = Window.partitionBy('g').orderBy(desc('date'))  
    
    TEST_df.withColumn('g', when(col('col1') == -1, expr("sum(int(col1!=-1))").over(w1))) \
        .withColumn('residual', when(col('col1') == -1, count('*').over(w2) + 1).otherwise(1)) \
        .withColumn('prev_col1',expr("last(nullif(col1,-1),True)").over(w1)) \
        .withColumn('want', coalesce(lag(expr("prev_col1 + residual")).over(w1),lit(-1))) \
        .orderBy('date').show()
    +----------+----+----+--------+---------+----+
    |      date|col1|   g|residual|prev_col1|want|
    +----------+----+----+--------+---------+----+
    |2020-08-01|   3|null|       1|        3|   2|
    |2020-08-02|   1|null|       1|        1|   6|
    |2020-08-03|  -1|   4|       3|        3|   5|
    |2020-08-04|  -1|   4|       2|        3|   4|
    |2020-08-05|   3|null|       1|        3|   8|
    |2020-08-06|  -1|   3|       2|        6|   7|
    |2020-08-07|   6|null|       1|        6|   5|
    |2020-08-08|   4|null|       1|        4|   6|
    |2020-08-09|   5|null|       1|        5|  -1|
    +----------+----+----+--------+---------+----+
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-02-14
      • 2020-08-06
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-05-29
      相关资源
      最近更新 更多