【发布时间】:2019-11-20 08:33:25
【问题描述】:
我目前正在开发一个专有的 PDF 解析器,它可以读取具有各种类型数据的多种类型的文档。在开始之前,我在考虑是否可以阅读 PowerPoint 幻灯片。我的雇主使用需要图像和背景设计的演示指南 - 是否可以构建一个解析器,可以从这些 PowerPoint PDF 中读取数据,而不会妨碍幻灯片装饰?
所以工作流程基本上是这样的:
- 在项目结束时,项目报告以演示文稿的形式交付。
- 演示文稿将转换为 PDF。
- PDF 将提交给我的申请。
- 应用程序将阅读幻灯片并创建以数据为中心的报告以供快速查看。
该应用程序的目标是大量减少需要阅读的量,因为其中一些演示报告可能有很多页,而且一天中没有足够的时间。
【问题讨论】:
-
MS Office PDF 导出可能会导出带标签的 pdf。使用标记信息导出可能会改善您的结果。
标签: python parsing pdf pdf-scraping