【问题标题】:Split PDF after RegEx: Where should I start?在 RegEx 之后拆分 PDF:我应该从哪里开始?
【发布时间】:2011-05-18 21:43:11
【问题描述】:

我正在尝试根据某种正则表达式拆分庞大的 PDF

[A-Z][a-z]+(\s–\s)[A-Z][a-z]+

因为在每个实例开始一个新的“部分”之后,我需要将其拆分为自己的文档。

我不知道从哪里开始,或者先看什么语言。

任何帮助将不胜感激。

【问题讨论】:

  • 我认为您最好使用库来拆分 PDF,因为 PDF 的专有结构过于复杂,无法通过正则表达式进行拆分。
  • 没有机会。 PDF 包含多种不同格式中的任何一种的压缩数据。直接在 PDF 文件中搜索正则表达式是错误的方式。

标签: java php python regex pdf


【解决方案1】:

在字节流级别拆分 PDF 不会生成有效的 PDF。

既然我们已经解决了这个问题,您将需要一个库(Java 中的 Apache PDFBox,python 中的 pyPDF)来解析 PDF 并让您迭代文本,应用您的正则表达式。找到文本后,您可以使用库来提取相关的页面范围。

【讨论】:

    【解决方案2】:

    也许 PDF 工具包可以帮助http://www.pdflabs.com/tools/pdftk-the-pdf-toolkit/

    【讨论】:

      【解决方案3】:

      PDF 包含多种文件结构,它不仅仅是页面的集合。所以你不能把它拆散。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2018-12-20
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2018-03-05
        • 2011-11-04
        相关资源
        最近更新 更多