【发布时间】:2020-12-01 17:16:07
【问题描述】:
有什么方法可以加快保存过程。我有一个仅包含 600,000 行的数据框,我的程序在保存文件时卡住了大约 8 个小时,然后我才因为沮丧而退出程序。 Pandas 将在 45 秒内成功保存一个包含 50,000 行的数据框,但由于某种原因,这个有点大的数据框让它出错了。我知道它肯定是使程序变慢的 pandas to_csv 命令。这是一些代码: df.to_csv(mes_csv + "_copy.csv.gz", chunksize=100000, header=True, compression='gzip', encoding='utf-8')
【问题讨论】:
-
这很奇怪。你介意生成mcve吗?
-
这可能是因为您正在使用压缩。压缩数据可能需要一些时间。可以试试不压缩保存,看看时间是否合理?
标签: python pandas performance csv