【问题标题】:PDFMiner - Get text linesPDFMiner - 获取文本行
【发布时间】:2013-08-06 07:36:02
【问题描述】:

我正在使用PDFMiner Python library 将PDF 文件转换为文本,使用this SO answer 中提供的代码sn-p。问题是 PDF 是三列格式,我需要阅读每一行。但是,我得到的文本是无序的:有时混合第一列和第二列,有时混合第三列......由于文本不遵循任何逻辑顺序,我无法解析每一行。那么,有没有办法使用 PDFMiner 获取 PDF 文件的每一行?

编辑:

PDFMiner 带有一个命令行工具,pdf2txt.py,用于将 PDF 转换为文本。使用它并将0.05设置为字边距,我可以获得更好的格式化文本,但无法达到目标。

【问题讨论】:

    标签: python pdftotext


    【解决方案1】:

    我在解析表格时也遇到过类似情况*。对我有用的是提取 HTML。然后您可以解析 HTML 表格并考虑表格标签(请参阅 HTMLParser 的 python 文档。)我只有表格要查找。

    我的两分钱:)

    *Word 中的表格复制到 QT TextEdit 小部件中。小部件接受富文本,但如果导出为文本,表格会被弄乱。导出为 HTML,解析 HTML,获取数据 :) 是在工作中做的,这里没有代码。

    【讨论】:

    • 能否请您添加一个链接以在其中找到 HTMLParser 的文档。谢谢!
    • 你说的不是pdfminer.converter.HTMLConverter吗?链接为programtalk.com/python-examples/…
    猜你喜欢
    • 2012-09-18
    • 2021-05-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-12-17
    • 1970-01-01
    相关资源
    最近更新 更多