【问题标题】:pdf text extracter class in phpphp中的pdf文本提取器类
【发布时间】:2011-06-29 13:04:18
【问题描述】:

php 中是否有任何类可以从 pdf 文件中提取所有文本,以便我可以将其存储在 mysql 数据库中。我的 pdf 包含许多元素,例如图像、表格、纯文本、表单元素、图表等。

到目前为止,我在过去两天看到了很多提取文本的课程,但没有人促进完整的文本提取,没有从 pdf 中提取完整的文本。

我想从给定的 pdf 文件中提取所有文本,即使文本在表​​格等中。

有人知道吗? :)

非常感谢。祝你有美好的一天:)

【问题讨论】:

    标签: php pdf text-extraction


    【解决方案1】:

    找到下面的网址,

    Reading the clean text from PDF with PHP

    【讨论】:

    • 它没有提取完整的文本,我已经尝试过这个.. :)
    【解决方案2】:

    如果您在 linux 服务器上运行它,您可以尝试使用 apdf2text 通过 exec 调用它,然后获取输出文件的内容。

    请注意,周围有一些 pdf 到文本的脚本,你会得到不同的里程数。

    【讨论】:

    • 我怎么用它,我听不懂你? php中没有类。
    • 不,它不是一个 php 类,它需要包装在一个函数中以传入一个文件名,然后返回您可以自己处理的文本。
    【解决方案3】:

    我已经测试了很多命令行程序,但没有一个有 100% 的结果。 所以我用 PHP 开始了我自己的库:

    https://github.com/smalot/pdfparser

    目前它是面向文本的,但将计划支持图像。

    如果您遇到问题,感谢您将您的 PDF 发送给我,如果可能,请提供您制作它的方式。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2018-10-07
      • 1970-01-01
      • 1970-01-01
      • 2015-08-17
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多