【问题标题】:Python 3.7: Performance tuning on huge data files comparisonPython 3.7:大数据文件比较的性能调优
【发布时间】:2018-11-13 16:17:09
【问题描述】:

我有两个大小为 3 GB 的 csv 文件来比较并存储第三个文件中的差异 文件。

Python 代码:

with open('JUN-01.csv', 'r') as f1:
    file1 = f1.readlines()

with open('JUN-02.csv', 'r') as f2:
    file2 = f2.readlines()

with open('JUN_Updates.csv', 'w') as outFile:
    outFile.write(file1[0])
    for line in file2:
        if line not in file1:
            outFile.write(line)

执行时间:45 分钟并且仍在运行...

【问题讨论】:

  • 接下来你要对这些文件做什么?将读数包装为迭代器或使用文件块,在 SO 上有很多答案。
  • 顺序重要吗?文件是否开始排序?你看过例如stackoverflow.com/questions/4717250/…吗?
  • @IljaEverilä,不!顺序无关紧要。
  • 我知道您已经尝试过使用 Python 并标记为 Python,但如果使用其他工具(例如 tailsortcomm),这可能是一项更好的工作一些 posixy 操作系统。

标签: python python-3.x


【解决方案1】:

不确定是不是太晚了,但它来了。

我看到您正在内存中加载 2 个数组,以及您的完整文件。如果您说它们每个大约 3 GB,那就是试图在 RAM 中填充 6 GB 并可能进入交换。

此外,即使您成功加载文件,您也在尝试~ L1xL2 字符串比较(L1 和 L2 是行数)。

我在 1.2 GB(330 万行)中运行了以下代码,并在几秒钟内完成。它使用字符串哈希,并且只在 RAM 中加载一组 L1 integer32。

诀窍在这里完成,在将哈希字符串函数应用于文件中的每一行之后创建一个 set()(标题除外,您似乎要添加到输出中)。

file1 = set(map(hashstring, f1))

请注意,我将文件与自身进行比较(f2 加载与 f1 相同的文件)。如果有帮助,请告诉我。

from zlib import adler32

def hashstring(s):
    return adler32(s.encode('utf-8'))

with open('haproxy.log.1', 'r') as f1:
    heading = f1.readline()
    print(f'Heading: {heading}')
    print('Hashing')
    file1 = set(map(hashstring, f1))
    print(f'Hashed: {len(file1)}')

with open('updates.log', 'w') as outFile:
    count = 0
    outFile.write(heading)
    with open ('haproxy.log.1', 'r') as f2:
        for line in f2:
            if hashstring(line) not in file1:
                outFile.write(line)
            count += 1
            if 0 == count % 10000:
                print(f'Checked: {count}')

【讨论】:

  • 遇到错误:UnicodeDecodeError: 'ascii' codec can't decode byte 0xe1 in position 234: ordinal not in range(128)
  • 您可以尝试将文件视为二进制而不是文本,使用 open(..., 'rb') 并对原始字节进行哈希处理:with open('haproxy.log.1', 'rb') as f1: file1 = set(map(adler32, f1)) with open('updates.log', 'wb') as outFile: outFile.write(heading) with open ('haproxy.log.1', 'rb') as f2: for line in f2: if adler32(line) not in file1: outFile.write(line)
  • 我们可以对指定的 2 或 3 列执行相同的操作吗?
  • 当然,这是 Python Standard Library 中包含的 CSV 模块的一个很好的用例。您可以轻松地修改脚本以仅获取几列。由于 CSV 阅读器将它们保存为字符串,因此您可以将它们连接起来并继续使用 Adler32 进行散列。
【解决方案2】:

如果 difflib 有助于提高效率,请尝试以下操作:-

import difflib
import sys

with open('JUN_Updates.csv', 'w') as differenceFile:
    with open('JUN-01.csv', 'r') as june1File:
        with open('JUN-02.csv', 'r') as june2File:
            diff = difflib.unified_diff(
                june1File.readlines(),
                june2File.readlines(),
                fromfile='june1File',
                tofile='june2File',
            )

            lines = list(diff)[2:]
            added = [line[1:] for line in lines if line[0] == '+']
            removed = [line[1:] for line in lines if line[0] == '-']

            for line in added:
                differenceFile.write(line)

【讨论】:

  • 好吧,让我试试这个。
  • :) 没有改进
猜你喜欢
  • 1970-01-01
  • 2017-06-29
  • 2015-05-16
  • 2016-10-31
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多