【发布时间】:2017-06-01 13:15:42
【问题描述】:
我需要在大型数据集中查找重复项,所以我正在测试dedupe python 库。
我知道它被推荐用于小型数据集,所以我认为使用一台好的机器可以提高性能。我有一台 56 GB RAM 的机器,我正在为一个包含 200000 行的数据集运行类似于 "csv_example" 的测试。它可以工作,但内存使用率非常低,因此处理(CPU)。
阻塞阶段好像时间太长了:
INFO:dedupe.blocking:10000, 110.6458142 seconds
INFO:dedupe.blocking:20000, 300.6112282 seconds
INFO:dedupe.blocking:30000, 557.1010122 seconds
INFO:dedupe.blocking:40000, 915.3087222 seconds
谁能帮助我改善使用情况或告诉我是否有任何库/设置可以使程序使用更多可用资源?
【问题讨论】:
标签: python pyspark record-linkage python-dedupe