【发布时间】:2022-02-11 22:56:46
【问题描述】:
在 pyspark 上处理大数据后,我使用以下命令将其保存在 csv 中:
df.repartition(1).write.option("header", "true").option("delimeter", "\t").csv("csv_data", mode="overwrite")
现在,我想使用pd.read_csv() 再次加载它。
info = pd.read_csv('part0000.csv', sep='\t', header='infer')
info 作为 1 列返回,其中数据用逗号而不是 '\t' 分隔。
col1name,col2name,col3name
val1,val2,val3
我尝试指定 sep=',',但在某些行的列数超过 3 时出现解析错误。
如何在不跳过任何行的情况下解决这个问题?是否与 spark 有任何关系来解决它,例如指定 '|' 作为分隔符
【问题讨论】:
标签: python pandas dataframe pyspark