【问题标题】:Search in PDF, index it?在 PDF 中搜索,索引它?
【发布时间】:2011-03-09 21:09:47
【问题描述】:

我有 1000 多个可搜索的 PDF。

我需要一些插件或应用程序来索引它,例如 (http) joomla.natemaxfield.com

【问题讨论】:

    标签: php python pdf


    【解决方案1】:

    我们使用 Swish-e 为我们的网站编制索引,其中包括数千个 PDF、Word 文件甚至 WordPerfect 文件。它工作得很好。它是免费的、开源的,并且与 PHP 很好地集成。

    http://swish-e.org/index.html

    从他们的主页:

    Swish-e 是一种快速、灵活且免费的 用于索引的开源系统 网页集合或其他 文件。 Swish-e 非常适合 收集一百万份文件或 更小。使用 GNOME™ libxml2 解析器和过滤器的集合, Swish-e 可以索引纯文本、电子邮件、 PDF、HTML、XML、Microsoft® Word/PowerPoint/Excel 等等 任何可以转换为 XML 的文件 或 HTML 文本。 Swish-e 也经常 用于补充数据库,如 MySQL® DBMS 用于非常快速的全文 搜索。

    【讨论】:

      【解决方案2】:

      看看PDFMiner。它可以很容易地做你想做的事。另外,请搜索类似的问题,因为这可能是欺骗:Python module for converting PDF to text

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2011-09-25
        • 2011-08-23
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2017-02-28
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多