【问题标题】:Recover text from PDF file when normal methods fail当正常方法失败时从 PDF 文件中恢复文本
【发布时间】:2013-11-28 08:18:44
【问题描述】:

我有几百个 PDF 文件,我需要从中提取部分文本。对于许多人来说,pdftotext 可以正常工作,但对于其他人来说,它会遗漏大部分文本。如果我在 Acrobat 中打开 PDF 并手动选择该文本并将其复制/粘贴到 emacs 中,然后查看没有编码的文件,我会得到如下内容:

 Husband \364\200\200\272\364\200\201\213\364 etc.

如何正确提取文本?

我应该提到我已经尝试从 Acrobat 中另存为文本;还尝试在复制前应用 Acrobat 的 Document=>OCR 功能。

【问题讨论】:

  • 您是否阅读了右侧相关栏中的所有链接?要获得问题的规模和缺乏普遍的普遍解决方案?也许如果您发布示例,有人可能会针对您的特殊情况提出解决方案。而且,要使 OCR 工作,您应该首先光栅化文件。
  • 感谢@VadimR,这些建议很有帮助。

标签: pdf character-encoding text-extraction


【解决方案1】:

为什么不先将 PDF 转换为 doc 或 txt?请参阅指南: http://www.aolor.com/pdf-converter/user-guide.html

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-12-26
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多