【发布时间】:2012-10-28 19:14:50
【问题描述】:
我有一个问题。我正在尝试从 pdf 文档中提取结构化文本。由于 pdf 通常没有结构,我想我可以开始解析用乳胶生成的 pdf,它应该有一些结构。
您知道我可以使用 Latex 生成的 pdf 中的任何模式来解析 pdf 吗?
【问题讨论】:
-
虽然我怀疑你会发现一些非常好的模式,但如果你更严格地定义环境,机会可能会增加。上次我接触 LaTeX 时,从 LaTeX 创建 PDF 有不同的路径:通过 TeX 设备独立文件,即 LaTeX -> DVI -> [PS ->] PDF,直接通过 LaTeX -> PDF。如果有模式,那么对于那些不同的路径,它们肯定是不同的。模式还可能取决于所涉及软件的版本。
标签: java parsing pdf latex structure