【问题标题】:How does OCR work in Google Drive?OCR 如何在 Google Drive 中工作?
【发布时间】:2013-02-10 02:46:14
【问题描述】:

我有noticed,Google Drive 可以识别 PDF(以及其他文件,如图像和文本文档)中的文本。出于好奇,我想知道他们做了什么来显示可选择和可搜索的 img 标签。例如,当我在 Chrome 开发人员工具中检查 Google Drive 文档时,每个页面都是一个图像,但它不像图像,因为文本是可选择的。另一方面,当我放大时,似乎加载了另一个分辨率更高的图像。我认为这与 scribd 使用的技巧相同。

我还了解到,Google 一直在改进 tesseract-ocr,并且 Google 图书团队帮助 Google Drive 中的 OCR 实施,但我不确定以他们的方式生成 img 标签的过程是什么它。

幕后发生了什么?

谢谢!

【问题讨论】:

    标签: pdf ocr google-docs tesseract


    【解决方案1】:

    我不能确定到底发生了什么,但我会把我的发现告诉你。如果您查看驱动器中文件的 pdf 视图的 HTML 代码,您会发现类似这样的内容。

    <div id="page-pane" class="">
       <div id=":2h.page.0" class="page-element goog-inline-block" style="width: 820px;">
          <div>
             <div class="highlight-pane"></div>
             <div class="highlight-pane">
                <div class="highlight selection-highlight" style="left: 154px; top: 142px; width: 268px; height: 13px;"></div>
                <div class="highlight selection-highlight" style="left: 105px; top: 164px; width: 73px; height: 14px;"></div>
                <div class="highlight selection-highlight" style="left: 154px; top: 181px; width: 128px; height: 13px;"></div>
             </div>
             <div class="highlight-pane"></div>
             <div class="highlight-pane"></div>
             <img class="page-image" style="width: 800px; height: 1131px; display: none;" src="https://docs.google.com/file/d/0BzxfQAgMGNM6VGg4RFlBZkdoOWM/image?pagenumber=1&amp;w=138" /><img class="page-image" style="width: 800px;" src="https://docs.google.com/file/d/0BzxfQAgMGNM6VGg4RFlBZkdoOWM/image?pagenumber=1&amp;w=800" />
             <p id=":2h.a11y.0" class="accessibility-text" tabindex="-1"></p>
          </div>
       </div>
    

    2h.page.0 中有四个 highlight-pane div 和一个 img div(pdf 的第 0 页)。 img div 显示您谈论的图像。这只是一个简单的图像,这里没有 OCR。 您提到的选定文本来自第二个highlight-pane,当您在图像上拖动一个框时,它会动态添加 div。第二个highlight-pane 内的三个 div 代表选定的文本(对应于三行选定的文本)。

    当您访问页面时会发生以下情况。

    • 从存储在驱动器中的 pdf 查看页面图像。
    • 您在页面上选择了一些内容。您创建一个拖动框。
    • 选择触发在 pdf 上运行 OCR 的 javascript(可能已经计算了 OCR 输出)。
    • OCR的输出添加到highlight-panediv里面的div

    【讨论】:

    • 太棒了。我唯一不确定的是他们如何跟踪选定或搜索的文本?我的意思是,您选择的东西,如您所说,会创建一个拖动框。但是,它们如何将图像中的选定位置与该位置的 OCRed 文本匹配?
    【解决方案2】:

    OCR 有两种基本方法:矩阵匹配和特征 萃取。识别字符的两种方式中,矩阵匹配 是更简单更常见的。

    矩阵匹配将 OCR 扫描仪视为字符的内容与 字符矩阵或模板库。当图像匹配时 在给定级别的这些规定的点矩阵之一 相似性,计算机将图像标记为相应的 ASCII 字符。

    特征提取是没有严格匹配规定的 OCR 模板。也称为智能字符识别 (ICR),或 拓扑特征分析,此方法因“计算机 智能”由制造商应用。计算机寻找 一般特征,例如开放区域、封闭形状、对角线、 线交叉点等。这种方法比 矩阵匹配。当 OCR 遇到 字体样式有限,内部几乎没有变化 每种风格。角色难以预测的地方、特征或 地形分析更胜一筹。

    如果您想了解更多信息,请访问:http://www.dataid.com/aboutocr.htm

    【讨论】:

    • 谢谢。很好的解释,但我想知道 Google Drive 的实现,而不是 OCR 本身。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2013-07-28
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-16
    • 1970-01-01
    相关资源
    最近更新 更多