【发布时间】:2021-04-01 22:06:09
【问题描述】:
我有以下适用于熊猫数据框的功能
def event_list(df,steps):
df['steps_present'] = df['labels'].apply(lambda x:all(step in x for step in steps))
return df
DataFrame 有一个名为标签的列,其值作为列表。此函数接受数据框和步骤(这是一个列表)并输出带有新列步骤的数据框如果参数列表中的所有元素都存在于数据框列中
value in df['labels'] = [EBBY , ABBY , JULIE , ROBERTS]
event_list(df,['EBBY','ABBY']) 将为该记录返回 True,因为 EBBY 和 ABBY 存在于数据框列表列中。
我想在 pyspark 中创建一个类似的函数。
【问题讨论】:
标签: python pandas apache-spark pyspark apache-spark-sql