【发布时间】:2021-12-03 23:51:39
【问题描述】:
我正在尝试应用一个用 Python 制作的函数,以便在 PySpark 上可读。
open() 函数在 PySpark 中不可读。在这种情况下如何更换?
我有一个需要排序的非结构化列表:
import csv
from operator import itemgetter
my_list = [
[3, 'ab','ac','ad'],
[4, 'ae','af','at','aj','aa'],
[1, 'ar','aa','at','as'],
[2, 'ay','au','aa','ar','aa','a1']
]
# Sorting this list:
sorted_list = sorted(my_list, key=itemgetter(0))
这是我需要更改的在 Python 中工作的函数:
with open('file.txt', 'w', newline='') as myfile:
wr = csv.writer(myfile, quoting=csv.QUOTE_NONE, delimiter='|')
wr.writerows(sorted_list)
由于列表列表的非结构化类型,我无法在下面使用此功能:
df = pd.DataFrame(sorted_list)
spark_df = spark.createDataFrame(df)
spark_df.write.csv("file.txt".format(root),sep="|", mode='overwrite', quote="\u0000")
在 Python 或 PySpark 中有解决方法吗?
【问题讨论】:
标签: python pandas apache-spark pyspark