【发布时间】:2018-11-13 16:17:09
【问题描述】:
我有两个大小为 3 GB 的 csv 文件来比较并存储第三个文件中的差异 文件。
Python 代码:
with open('JUN-01.csv', 'r') as f1:
file1 = f1.readlines()
with open('JUN-02.csv', 'r') as f2:
file2 = f2.readlines()
with open('JUN_Updates.csv', 'w') as outFile:
outFile.write(file1[0])
for line in file2:
if line not in file1:
outFile.write(line)
执行时间:45 分钟并且仍在运行...
【问题讨论】:
-
接下来你要对这些文件做什么?将读数包装为迭代器或使用文件块,在 SO 上有很多答案。
-
顺序重要吗?文件是否开始排序?你看过例如stackoverflow.com/questions/4717250/…吗?
-
@IljaEverilä,不!顺序无关紧要。
-
我知道您已经尝试过使用 Python 并标记为 Python,但如果使用其他工具(例如
tail、sort和comm),这可能是一项更好的工作一些 posixy 操作系统。
标签: python python-3.x