【发布时间】:2021-08-24 14:24:36
【问题描述】:
df = spark.createDataFrame(
[
(1, "AxtTR"), # create your data here, be consistent in the types.
(2, "HdyOP"),
(3, "EqoPIC"),
(4, "OkTEic"),
], ["id", "label"] )# add your column names here]
df.show()
下面的代码在 python 中,我使用 apply 函数并尝试提取每行的前 2 个字母。我想在 pyspark 中复制相同的代码。其中一个函数用于对每一行应用并获取输出。
def get_string(lst):
lst = str(lst)
lst = lst.lower
lst= lst[0:2]
return(lst)
df['firt_2letter'] = df['label'].apply(get_string)
如下图所示的黄色标记是预期的输出。
【问题讨论】:
标签: python string apache-spark pyspark user-defined-functions