【发布时间】:2013-02-10 02:46:14
【问题描述】:
我有noticed,Google Drive 可以识别 PDF(以及其他文件,如图像和文本文档)中的文本。出于好奇,我想知道他们做了什么来显示可选择和可搜索的 img 标签。例如,当我在 Chrome 开发人员工具中检查 Google Drive 文档时,每个页面都是一个图像,但它不像图像,因为文本是可选择的。另一方面,当我放大时,似乎加载了另一个分辨率更高的图像。我认为这与 scribd 使用的技巧相同。
我还了解到,Google 一直在改进 tesseract-ocr,并且 Google 图书团队帮助 Google Drive 中的 OCR 实施,但我不确定以他们的方式生成 img 标签的过程是什么它。
幕后发生了什么?
谢谢!
【问题讨论】:
标签: pdf ocr google-docs tesseract