【问题标题】:Programatically search multiple PDF documents for a series of keywords以编程方式在多个 PDF 文档中搜索一系列关键字
【发布时间】:2014-02-15 22:33:25
【问题描述】:

问题

我有 500 多个 PDF 文件,我需要搜索一组关键字的实例,并为每组关键字在文件中使用的次数打分(最好是转储到 CSV 文件中)。

例如我可以有以下

keyword-set-1 = "foo" "bar";
keyword-set-2 = "jon" "doe";

以及带有以下文本的 PDF 文件

"jon doe and mary doe are both at the bar."

这会给我以下分数

keyword-set-1 = 3 (jon, doe and doe)
keyword-set-2 = 1 (bar)

我已经做了什么

如果我正在搜索纯文本文件,我已经找到了多种可以在 PHP 或 Java 中执行此操作的方法。但是,我还没有找到 PDF 文件的单一解决方案。我考虑过使用 PDF miner 将所有 PDF 转换为纯文本,但是如果可能的话,我宁愿避免这种情况。

PDF 是高质量的,不是扫描的表格。

【问题讨论】:

    标签: pdf


    【解决方案1】:

    您能指定 PDF 的质量吗?他们是扫描表格吗?那么您可能需要使用 OCR。我可以推荐 Tesseract(也需要像 ImageMagick 这样的图像转换器),它将 PDF 转换为 HTML 文件。然后,您可以使用 Jsoup 轻松地遍历单词。

    如果没有扫描,您可以使用 PDFBox。这也是一个Java库。

    Tesseract:https://code.google.com/p/tesseract-ocr/ PDFBox:http://pdfbox.apache.org/

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2010-10-08
      • 2020-10-11
      • 2011-06-15
      • 1970-01-01
      • 1970-01-01
      • 2017-06-12
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多