【发布时间】:2010-10-30 14:00:29
【问题描述】:
我的目标是从 PDF 文件中提取文本和图像,同时解析其结构。解析结构的范围并不详尽;我只需要能够识别标题和段落。
我尝试了几种不同的方法,但都没有走得太远:
- 将 PDF 转换为文本。它对我不起作用,因为我丢失了图像和文档的结构。
- 将 PDF 转换为 HTML。我找到了一些可以帮助我解决这个问题的工具,迄今为止最好的工具是 pdftohtml。该工具在演示方面非常出色,但我无法成功解析 HTML。
- 将 PDF 转换为 XML。同上。
有人对如何解决这个问题有任何建议吗?
【问题讨论】:
-
为什么一直无法成功解析html?
-
我想跟踪标题,其中一种方法是通过样式识别它们。一些标题的样式混合在一起,因此会产生一些问题。
标签: pdf parsing extraction