【发布时间】:2017-01-11 01:30:48
【问题描述】:
这是一个很长的镜头,但我不得不问。我需要任何可能使 Tesseract OCR 引擎更快的想法。我正在处理由大约 2000 万页文本组成的 200 万份 PDF,我需要尽可能地发挥性能。目前的估计是,如果我什么都不做,这将需要大约一年的时间。
我已经调整了输入图像以获得一些提升,但我需要考虑其他方法。我认为目前对图像的改进不会让我有所收获。
例如:
- 可以使用优化标志或类似的东西重新编译 Tesseract 吗?
- 是否可以使用共享 CPU 内存或 GPU?
- 我能否以某种方式告诉 Tesseract 使用更多内存(我有很多)?
- 还有其他方法可以让 CPU 密集型 C++ 程序更快吗?
目前,Tesseract 由我们的任务运行器 Celery 运行,它使用多处理来完成其工作。这样,我可以让服务器看起来像这样:
我(显然?)不知道我在说什么,因为我是一名 Python 开发人员,而 Tesseract 是用 C++ 编写的,但如果有任何方法可以在这里得到提升,我会喜欢想法。
【问题讨论】:
标签: python c++ performance tesseract