【问题标题】:PDF to Structured FormatPDF转结构化格式
【发布时间】:2012-09-28 23:17:41
【问题描述】:

我有大量的 PDF 需要转换为我可以解释的结构化格式(HTML/XML/等)

PDF 采用以下格式: http://img840.imageshack.us/img840/5407/pdfv.png

到目前为止,我已经尝试了很多转换为 HTML 的软件,但它们都没有分离图像的功能,它们只是将页面的打印屏幕作为没有文本的页面,然后将此图像用作背景html,使用css定位文本

像这样:http://img37.imageshack.us/img37/5015/examplelp.jpg

我有一堆 PDF,因此无法手动处理每个图像。有谁知道这方面的任何解决方案(甚至是付费软件)?

【问题讨论】:

  • 图像不再可用。能否请您添加一个最近的链接?

标签: html xml pdf


【解决方案1】:

前段时间我遇到了类似的问题,最后编写了自己的解决方案。它被称为PDFX,可以免费使用。它将 PDF 转换为结构化格式的 XML,并单独呈现 PDF 中的任何位图图像(不是矢量图形)。

可以在here 找到示例输入/输出。您可能想尝试一下。

【讨论】:

  • 这个很好,目前看到的最好的解决方案,非常感谢分享。
  • 哇!这就像魅力一样。您为示例提供的链接不起作用。它是否仅作为在线服务提供?有人如何使用它进行批量转换?我正在做我的大学项目,我必须将数千篇研究论文转换成某种结构格式,以便我可以对其执行一些 NLP 任务。这个工具可以吗?
  • @RishabhGupta - 抱歉回复晚了,我没有收到通知。我已经 7 年没有维护这个网站了。示例链接只是您通过向系统提供这篇论文获得的结果页面(“工作详细信息”):ncbi.nlm.nih.gov/pmc/articles/PMC2687974/pdf/btp220.pdf PDFX 在我离开大学之前已经转换了超过 70 万篇文章。如果您阅读了关于可接受使用的使用指南,您应该可以使用数千个(如果它仍然与您相关)
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2019-04-18
  • 2018-09-27
  • 2015-01-05
  • 1970-01-01
  • 2021-10-05
  • 2021-12-24
  • 1970-01-01
相关资源
最近更新 更多