【问题标题】:Python PDFMiner error: "No /Root object! - Is this really a PDF?"Python PDFMiner 错误:“没有 /Root 对象!-这真的是 PDF 吗?”
【发布时间】:2013-06-26 22:42:08
【问题描述】:

我收到此错误“没有 /Root 对象!- 这真的是 PDF 吗?”将我的 MAC 计算机与 Python 2.7 和 PDFMiner 版本 20110515 一起使用。 pdf 文件没有损坏,因为具有相同文件的相同程序在我的 PC 计算机上运行!我也尝试了许多 pdf,并且所有这些都存在此错误。关于我应该在我的 MAC 中更改什么以避免出现此错误的任何想法?

【问题讨论】:

  • PDFMiner 20110515 版本是 Beta 版本,因此可能存在错误。幸运的是,它是纯 Python,可以帮助简化调试。您描述的问题可能是由于正在解析的文件中处理行尾的方式。确保它们以二进制模式打开,即fp = open('mypdf.pdf', 'rb')。对问题文件运行包含的dumppdf.py 实用程序也可能会有所帮助。最后,错误可能是由于您使用的 Python 解释器因机器而异。并非所有版本的 Python 都内置了通用换行支持。

标签: python macos pdf document-root pdf-parsing


【解决方案1】:

我找到了问题的根源:

我有一种方法可以读取目录中的所有文件并解析它们。原来我在那个目录中有一个不是pdf文件的隐藏文件!

这是我解决问题的方法:

for filename in os.listdir(INPUT_DIR_NAME):
    if filename.endswith('.pdf'):
        #do stuff!

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-03-26
    • 1970-01-01
    • 2018-01-05
    • 2017-02-17
    • 1970-01-01
    • 1970-01-01
    • 2011-03-23
    • 2012-12-15
    相关资源
    最近更新 更多