【发布时间】:2021-09-09 20:02:58
【问题描述】:
我有两个 pdf 文档,它们的布局相同,信息不同。问题是: 我可以完美地读取一个,但另一个数据无法识别。
这是一个我可以完美阅读的例子,下载here:
from_pdf = camelot.read_pdf('2019_05_2.pdf', flavor='stream', strict=False)
df_pdf = from_pdf[0].df
camelot.plot(from_pdf[0], kind='text').show()
print(from_pdf[0].parsing_report)
这是预期的数据框:
这是一个例子,我看了之后无法识别信息,下载here:
from_pdf = camelot.read_pdf('2020_04_2.pdf', flavor='stream', strict=False)
df_pdf = from_pdf[0].df
camelot.plot(from_pdf[0], kind='text').show()
print(from_pdf[0].parsing_report)
这是包含无法识别信息的数据框:
我不明白我做错了什么以及为什么相同的代码对两个文件都不起作用。我需要一些帮助,谢谢。
【问题讨论】:
-
cid 基本上就是人物身份。您的 PDF 似乎没有正确构建,导致没有保存它使用的字体。将其报告给构建它的团队或将 PDF 转换为图像并尝试 OCR-ing。
标签: python-camelot