【问题标题】:OCR tool for handwritten mathematical notes用于手写数学笔记的 OCR 工具
【发布时间】:2015-02-03 23:16:32
【问题描述】:

我有一个包含 100 多页手写页面的 pdf,我需要将其转换为机器可读的文本。到目前为止,我已经尝试过 tesseract 和免费的在线工具,但没有成功。输出似乎是乱码。

tesseract myscan.png out -l eng

我附上了一个示例页面。它包含文本、数学符号(例如积分符号)和偶尔的图片。

也许我用错了正方体?任何人都可以尝试从中获得不错的输出吗?

【问题讨论】:

  • 您需要的是计算机视觉和解释的整个复杂领域。这并不简单,也没有快速的答案。这就是为什么公司花费数年和数百万美元来开发这些工具的原因。如果无法识别笔迹,要么找一个可以识别它的工具,要么构建一个专门针对这个笔迹的工具。
  • 我应该提到,当我在 onenote 中使用 OCR 工具(创建本文档的基础上)时,它似乎确实提供了合理的输出。我不期待精确的转换,只是为了至少有一个合理的输出。

标签: ocr


【解决方案1】:

我使用http://www.techsupportalert.com/best-free-ocr-software.htm 当心安装程序试图用其他东西加载你 当它工作时,它只是给你一些复制和粘贴的东西。 不过不要急着下载这个,先试试你的。

问题可能不在于软件,而可能是您的输入。

以 600 dpi 扫描。 尝试增加对比度并锐化图像。字母越薄,背景越清晰,循环的间距越清晰,OCR 捕获的机会就越大。

这些调整最好在您的原始扫描软件中进行。 8MP 或更好的相机也可以进行扫描。

扫描后使用 GIMP 进行调整。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2022-10-04
    • 2017-01-16
    • 1970-01-01
    • 2023-03-21
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多