【问题标题】:Extract HTML table from PDF file using PHP?使用PHP从PDF文件中提取HTML表格?
【发布时间】:2013-11-04 13:00:12
【问题描述】:

我想知道是否可以从 PDF 文件、数组或类似文件中提取数据表,以便我可以使用 PHP 导入表数据? 我安装了 DomPDF 来创建 PDF 文件,但这没有阅读 PDF 的选项。 如果我用 PHP 读取 PDF 文件,我会得到一个编码字符串:

%PDF-1.5 5 0 obj <>>> endobj 6 0 obj <>stream x��ێ+��W�\`��E���u

任何帮助将不胜感激。

亚当

【问题讨论】:

  • 你想用它实现什么?为什么选择 PDF?
  • 我通过电子邮件收到一份 PDF,其中包含需要输入我们数据库的 HTML 数据表。我可以接收电子邮件并保存 PDF,但我无法阅读 PDF。发送文件的第 3 方不能以任何其他格式发送。
  • 那么,我恐怕你很不走运。有几个问题正在寻找 PDF 解析器,例如this one,也许那里的答案之一可以帮助你。

标签: php parsing pdf


【解决方案1】:

这篇文章很老了,但似乎有相当数量的观点。

我正在从事一个类似的项目,并且在 https://github.com/mgufrone/pdf-to-html 方面取得了一些成功。 HTML 返回的只是一堆绝对定位的 p 标签,但如果您的 pdf 格式一致,您可能会很幸运地解决表格或至少获取您需要的数据。

只要确保您安装了 poppler 实用程序即可。

【讨论】:

    猜你喜欢
    • 2023-02-20
    • 2020-06-30
    • 1970-01-01
    • 1970-01-01
    • 2017-08-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多