【发布时间】:2021-05-23 23:30:40
【问题描述】:
有 2 个数据框,其中一个包含价格信息如下(第 1 天到第 100 天为 100 行),
StoreId,ItemID, Date,Price
HH-101,item1, d_1, €9
HH-101,item1, d_2, €7
……………………………
DH-101,item1, d_90, €4
……………………………
HH-101,item1, d_100, €3
第二个数据框是一个销售信息,如图所示(第 1 天到第 100 天为 100 列但 1 行)
Stored_ID, ItemID, d-1, d-2, d-3,……. d-90,d-100
HH-101 , item1 , 2 , 4 , 0,………..,12 ,22
HH-101 , item2 , 1 , 0 , 3 ……………,3 ,3
生成另一个数据框的最佳 PySpark 脚本是什么
新列,总和为
件数*销售价格,对应每件
example for store HH-101 and item1
2*9+ 4*7+........+.....+...12*4+22*3
是否有任何单个步骤而不是为超过 100 列写入产品总和
【问题讨论】:
标签: python scala dataframe apache-spark pyspark