【发布时间】:2017-02-21 17:16:05
【问题描述】:
我刚开始使用 Pyspark,想将文件保存为 csv 而不是文本文件。我尝试使用在 Stack Overflow 上找到的几个答案,例如
def toCSVLine(data):
return ','.join(str(d) for d in data)
然后
rdd = lines.map(toCSVLine)
rdd.saveAsTextFile("file.csv")
它的工作原理是我可以在 excel 中打开它,但是所有信息都放在电子表格的 A 列中。我希望能够将 rdd 中的每一列(例如(“ID”,“rating”)放入 excel 中的单独列中,因此 ID 将在 A 列中,而 rating 将在 B 列中。有办法吗?
【问题讨论】: