【问题标题】:Is it possible for a PDF data parser to read PowerPoint PDFs?PDF 数据解析器是否可以读取 PowerPoint PDF?
【发布时间】:2019-11-20 08:33:25
【问题描述】:

我目前正在开发一个专有的 PDF 解析器,它可以读取具有各种类型数据的多种类型的文档。在开始之前,我在考虑是否可以阅读 PowerPoint 幻灯片。我的雇主使用需要图像和背景设计的演示指南 - 是否可以构建一个解析器,可以从这些 PowerPoint PDF 中读取数据,而不会妨碍幻灯片装饰?

所以工作流程基本上是这样的:

  1. 在项目结束时,项目报告以演示文稿的形式交付。
  2. 演示文稿将转换为 PDF。
  3. PDF 将提交给我的申请。
  4. 应用程序将阅读幻灯片并创建以数据为中心的报告以供快速查看。

该应用程序的目标是大量减少需要阅读的量,因为其中一些演示报告可能有很多页,而且一天中没有足够的时间。

【问题讨论】:

  • MS Office PDF 导出可能会导出带标签的 pdf。使用标记信息导出可能会改善您的结果。

标签: python parsing pdf pdf-scraping


【解决方案1】:

将 PDF 解析为结构化数据总是很棘手,因为该格式面向精确打印,而不是易于编辑或数据提取。

基本上,PDF 包含诸如“在某个页面的某个 (x,y) 位置有一个带有此类文本的标签”之类的信息。

基本上,您很可能需要一些启发式方法才能将其转化为结构化数据。

它基本上是一种抓取形式。

在您最喜欢的搜索引擎上搜索PDF scraping 或类似的东西,这将是一个好的开始。

另外,你可能想看看那些类似的帖子:

【讨论】:

  • 非常感谢您的建议!我实际上要问 - 解析和抓取之间有什么区别?对初学者的问题表示歉意,但我感谢您的帮助!
  • 抓取是关于从某些来源中提取信息,这些来源没有经过专门格式化以允许这样做。
  • 我添加了一些可能很有趣的链接。
  • 非常感谢您的帮助!我真的很感激。
【解决方案2】:

PowerPoint PDF 不是 PDF 的类型

PDF 中不会有任何内容将页面上的元素识别为“幻灯片”图形,例如源自 PowerPoint 文件。

您可以尝试构建一种算法来决定从创建的 PDF 中删除内容,但这会很棘手,而且对我来说似乎是错误的方法。

更好的方法是将PPT“导出”为文本首先,例如在 Microsoft PowerPoint 中将其导出为 RTF 文件,以便您将所有文本导出并直接使用或将其转换为 PDF。

【讨论】:

  • 我明白,我只是为了简单起见。谢谢你的主意。我会先尝试转换演示文件。
猜你喜欢
  • 2014-05-07
  • 2017-08-15
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2020-11-27
  • 1970-01-01
  • 1970-01-01
  • 2020-12-09
相关资源
最近更新 更多