【发布时间】:2015-02-03 23:16:32
【问题描述】:
我有一个包含 100 多页手写页面的 pdf,我需要将其转换为机器可读的文本。到目前为止,我已经尝试过 tesseract 和免费的在线工具,但没有成功。输出似乎是乱码。
tesseract myscan.png out -l eng
我附上了一个示例页面。它包含文本、数学符号(例如积分符号)和偶尔的图片。
也许我用错了正方体?任何人都可以尝试从中获得不错的输出吗?
【问题讨论】:
-
您需要的是计算机视觉和解释的整个复杂领域。这并不简单,也没有快速的答案。这就是为什么公司花费数年和数百万美元来开发这些工具的原因。如果无法识别笔迹,要么找一个可以识别它的工具,要么构建一个专门针对这个笔迹的工具。
-
我应该提到,当我在 onenote 中使用 OCR 工具(创建本文档的基础上)时,它似乎确实提供了合理的输出。我不期待精确的转换,只是为了至少有一个合理的输出。
标签: ocr