【问题标题】:Get text position with tesseract 2.04 and Java使用 tesseract 2.04 和 Java 获取文本位置
【发布时间】:2011-12-05 19:00:00
【问题描述】:

我在一些图像中使用 Tesseract 2.04 执行 OCR,现在我必须得到文本的精确位置。但此版本不返回此信息。

我需要这个来生成一个可搜索的 pdf 文件。我已经学会了如何在 pdf 的底层中标记文本,但我需要标记该文本的位置。 我的第一个想法是在pdf中执行ocr,获取文本和文本的位置,用iText api在pdf中标记。

【问题讨论】:

标签: java pdf itext ocr tesseract


【解决方案1】:

在 iText 内部,我们还研究了 OCR。这是可能的(使用 Tesseract)。

工作流程:

  1. 使用 iText 从 pdf 中提取所有图像
  2. 使用 Tesseract 提取文本(以及坐标、字体等)
  3. 应用坐标变换(因为tesseract坐标系和iText坐标系不一样)
  4. 为 pdf 添加图层 (canvas.beginLayer)
  5. 在正确的位置绘制该图层中的所有文本

您可以进行更多优化。简短的建议列表:

  • 正确的基线
  • 正确的字体
  • 纠正拼写错误
  • 估计颜色
  • 估计背景颜色

这不是一件容易的事。但肯定有可能。

【讨论】:

    猜你喜欢
    • 2012-08-27
    • 2016-05-05
    • 2016-12-05
    • 1970-01-01
    • 2019-05-20
    • 1970-01-01
    • 2018-06-18
    • 1970-01-01
    • 2020-06-28
    相关资源
    最近更新 更多