【发布时间】:2018-02-07 01:03:30
【问题描述】:
这个问题似乎很奇怪,但我需要问这个问题,因为当我将文本作为图像和图形作为图像进行比较时,我看到了一个非常有趣的输出。
理想情况下,我正在确定一种工具或算法来比较两个 pdf,生成将突出显示它们之间差异的输出。
在 pdf 中有一些可能性,它将文本作为图像格式(纸张上的旧文本,被转换为 pdf)。
我们正在迁移那些旧版 pdf,最后我们正在与旧版和转换后的 pdf 输出进行比较。
我正在评估几个工具,如 Adobe dc pro、i-net pdfc 和 power pdf 等,用于比较两个 pdf。
在评估时,我可以看到图形图像在 pdf 的任何一侧都得到了比较(也不准确)。在完全忽略文本和图像的情况下,所有工具的结果都一致。
但我对文本即图像更感兴趣,因为我们处理更多的传统文本 pdf。
下面附上图片对比结果,可以看出图片之间的差异。
但是当我比较文本图像时,工具中没有突出显示差异。
据我了解,文本不作为图像图形进行比较,工具完全忽略了比较。我想澄清一下我的假设是否正确。
其次,我想知道如何比较pdf中的文本图像以产生差异?
【问题讨论】:
-
只有您使用的工具的作者才能回答您的第一个问题。 OCR 回答了第二个问题...您必须在两个图像中检测文本(通过其典型属性)OCR 并比较字符串、格式等...
标签: image image-processing graphics computer-vision text-comparison