【问题标题】:Low resources usage when using dedupe python使用 dedupe python 时资源使用率低
【发布时间】:2017-06-01 13:15:42
【问题描述】:

我需要在大型数据集中查找重复项,所以我正在测试dedupe python 库。

我知道它被推荐用于小型数据集,所以我认为使用一台好的机器可以提高性能。我有一台 56 GB RAM 的机器,我正在为一个包含 200000 行的数据集运行类似于 "csv_example" 的测试。它可以工作,但内存使用率非常低,因此处理(CPU)。

阻塞阶段好像时间太长了:

INFO:dedupe.blocking:10000, 110.6458142 seconds
INFO:dedupe.blocking:20000, 300.6112282 seconds
INFO:dedupe.blocking:30000, 557.1010122 seconds
INFO:dedupe.blocking:40000, 915.3087222 seconds

谁能帮助我改善使用情况或告诉我是否有任何库/设置可以使程序使用更多可用资源?

【问题讨论】:

    标签: python pyspark record-linkage python-dedupe


    【解决方案1】:

    您正在运行什么版本的重复数据删除?从1.6.8 开始,它应该很容易处理这种大小的记录集。

    但是,一般指导是,当您遇到内存问题时,请切换到使用 postgres 示例中的数据库进行阻塞。

    (我是 dedupe 的主要作者)。

    【讨论】:

    • 谢谢! dedupe 是一个很棒的库。是否可以在 spark 中使用这个库来重复数据删除 3000000 条记录? :)
    • 我对spark一无所知,但是重复数据删除应该可以很容易地处理300万条记录。
    • 运行上面提到的 Postgres 示例需要 20 多分钟。难道我做错了什么?或者这是可以预料的?加快速度真的很棒。
    猜你喜欢
    • 2018-07-19
    • 2013-11-22
    • 1970-01-01
    • 1970-01-01
    • 2022-11-10
    • 2021-03-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多