【发布时间】:2014-11-12 22:30:25
【问题描述】:
我有一个 Python 生成器,它可以从数据仓库中提取一个非常大的表。提取数据后,我正在使用 celery 以分布式方式处理数据。经过测试,我意识到发电机是瓶颈。它无法为芹菜工人提供足够的任务。这是我决定优化我的 python 生成器的时候。
更多关于生成器的细节
生成器通过块查询命中数据仓库,这些查询结果基本上是相互独立且无状态的。所以我认为这是使用multiprocessing 模块使其并行的好选择。我环顾了如何在没有太多方向的情况下并行化生成器获取。
因此,如果我的 Python 生成器生成无状态数据块,这应该是多处理的理想选择,对吧?有什么方法可以并行化 python 生成器?在 Python 生成器中使用并行性还有哪些副作用需要注意?
【问题讨论】:
标签: python parallel-processing generator