【问题标题】:Difference between text as image and graphics as image文本作为图像和图形作为图像之间的区别
【发布时间】:2018-02-07 01:03:30
【问题描述】:

这个问题似乎很奇怪,但我需要问这个问题,因为当我将文本作为图像和图形作为图像进行比较时,我看到了一个非常有趣的输出。

理想情况下,我正在确定一种工具或算法来比较两个 pdf,生成将突出显示它们之间差异的输出。

在 pdf 中有一些可能性,它将文本作为图像格式(纸张上的旧文本,被转换为 pdf)。

我们正在迁移那些旧版 pdf,最后我们正在与旧版和转换后的 pdf 输出进行比较。

我正在评估几个工具,如 Adob​​e dc pro、i-net pdfc 和 power pdf 等,用于比较两个 pdf。

在评估时,我可以看到图形图像在 pdf 的任何一侧都得到了比较(也不准确)。在完全忽略文本和图像的情况下,所有工具的结果都一致。

但我对文本即图像更感兴趣,因为我们处理更多的传统文本 pdf。

下面附上图片对比结果,可以看出图片之间的差异。

但是当我比较文本图像时,工具中没有突出显示差异。

据我了解,文本不作为图像图形进行比较,工具完全忽略了比较。我想澄清一下我的假设是否正确。

其次,我想知道如何比较pdf中的文本图像以产生差异?

【问题讨论】:

  • 只有您使用的工具的作者才能回答您的第一个问题。 OCR 回答了第二个问题...您必须在两个图像中检测文本(通过其典型属性)OCR 并比较字符串、格式等...

标签: image image-processing graphics computer-vision text-comparison


【解决方案1】:

我在 i-net PDFC 的作者公司工作,所以我也会回答你的第一个问题:

你的假设是正确的。 i-net PDFC 能够比较图像和形状,但它无法检测某些内容是否完全改变了它的含义,例如用于绘制字母的线条形状,或者在您的情况下是必须被识别为文本的图像。出于同样的原因,将 ASCII 艺术识别为图像也不起作用。即使它们的视觉外观相似,这些情况也会始终被检测为差异。

关于第二个问题:对一个或两个文档使用 OCR 转换工具是解决此问题的常见方法。由于转换后的文件中字体样式和换行方式不同,比较页面的简单图像比较不太可能起作用。 请注意,大多数 OCR 应用程序将使用渲染的页面图像进行识别。即使 PDF 文件中没有图像,这也可能导致不正确的识别结果。

i-net Software 已意识到这一普遍问题,目前正在开发 OCR 模块。它将提供一个选项,将识别仅应用于 PDF 文件中的图像。

【讨论】:

  • 这对您很有帮助,我正在为 ocr 内容确定不同的工具。如果 i-net pdfc 提供这个未来,那肯定会为 pdf 比较提供完整的解决方案。现在我们需要使用不同的工具进行不同的内容比较..
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2013-02-12
  • 1970-01-01
  • 2021-08-28
  • 2011-12-17
  • 1970-01-01
  • 2018-04-07
  • 1970-01-01
相关资源
最近更新 更多