【发布时间】:2011-05-18 21:43:11
【问题描述】:
我正在尝试根据某种正则表达式拆分庞大的 PDF
[A-Z][a-z]+(\s–\s)[A-Z][a-z]+
因为在每个实例开始一个新的“部分”之后,我需要将其拆分为自己的文档。
我不知道从哪里开始,或者先看什么语言。
任何帮助将不胜感激。
【问题讨论】:
-
我认为您最好使用库来拆分 PDF,因为 PDF 的专有结构过于复杂,无法通过正则表达式进行拆分。
-
没有机会。 PDF 包含多种不同格式中的任何一种的压缩数据。直接在 PDF 文件中搜索正则表达式是错误的方式。