【发布时间】:2012-01-03 18:52:55
【问题描述】:
我正在尝试使用多处理并行化应用程序 一个非常大的 csv 文件(64MB 到 500MB),逐行执行一些工作,然后输出一个固定大小的小文件 文件。
目前我做了一个list(file_obj),不幸的是它完全加载了
进入记忆(我想)然后我把这个列表分成 n 个部分,n 是
我要运行的进程数。然后我在分手时做一个pool.map()
列表。
与单个相比,这似乎有一个非常非常糟糕的运行时间 线程化,只需打开文件并迭代它的方法。有人可以 建议更好的解决方案?
此外,我需要按组处理文件的行,以保留 某列的值。这些行组本身可以拆分, 但任何组都不应包含此列的多个值。
【问题讨论】:
标签: python parallel-processing