【发布时间】:2017-01-14 21:20:05
【问题描述】:
我有一个 csv 文件太大而无法加载到内存中。我需要删除文件的重复行。所以我按照这种方式:
chunker = pd.read_table(AUTHORS_PATH, names=['Author ID', 'Author name'], encoding='utf-8', chunksize=10000000)
for chunk in chunker:
chunk.drop_duplicates(['Author ID'])
但是如果重复的行分布在不同的块中,上面的脚本似乎无法得到预期的结果。
有没有更好的办法?
【问题讨论】:
标签: python database pandas bigdata