【发布时间】:2015-09-21 07:02:12
【问题描述】:
我是 python 和 pdfminer 的新手,虽然不是一般的编程。我在 Windows 7 和 cygwin 上使用 Python 2.7。
我正在用 beautifulsoup 编写一个脚本来从 pdf 中提取特定信息。为此,我使用 pdf2txt 创建了此 pdf 的 .txt 和 .html 文件以用于测试。 只是常用的命令:
python pdf2txt.py -o output.txt input.pdf
python pdf2txt.py -o output.html input.pdf
它们都有相同的问题:某些文本行出现乱序。 在这个 pdf 上运行 pdf2txt,你会明白我的意思: (编辑:我找到了原始网站。)这是美属萨摩亚在这个页面上的:https://www.iamovers.org/ResourcesPublications/ShipperGuides.aspx?navItemNumber=580
例如,这是pdf第一页的一部分的正确布局:
所需文件
护照复印件(有些港口需要所有家庭成员的护照 列于 3299)
表格 CF-3299
补充声明(大多数港口要求)
英文详细盘点
签证副本(如果是非美国公民/永久居民)/永久副本 居民卡
I-94 邮票/卡
提单 (OBL) / 空运提单 (AWB) 副本
表格 DS-1504(外交官)
A-1 签证(外交官)
进口商安全申报 (ISF)
这就是使用 pdf2txt.py 进行 txt 和 html 转换的结果:
所需文件
护照复印件(某些港口需要 3299 上列出的所有家庭成员的护照)
表格 CF-3299
补充声明(大多数港口要求)
英文详细盘点
签证复印件(如果是非美国公民/永久居民)/永久居民卡复印件提单 (OBL) / 空运提单 (AWB) 副本
表格 DS-1504(外交官)
A-1 签证(外交官)进口商安全申报 (ISF)
I-94 邮票/卡片
出于某种原因,以字母“I”开头的行总是从它们的位置中取出,放在下一个空行或前一个空行上。还有一些其他角色也经常发生这种情况。
我已在此处发布此问题:https://github.com/euske/pdfminer/issues/121
这一定是pdfminer的问题。我还不太了解python,无法对包进行更改。有谁知道如何解决这个问题?
【问题讨论】:
标签: python python-2.7 pdf pdfminer