【发布时间】:2012-06-21 22:04:12
【问题描述】:
我有一个 PDF 文档,我需要从中读取数据。我发现,当我将所述 PDF 转换为 XML 文档时,我可以从中读取方便的标签,因此我需要一种在代码中将文件转换为 xml 的方法,这样我就可以使用映射器文件读取数据内容到数据库。
【问题讨论】:
-
我的“太宽泛”的感觉有点刺痛。你能试着澄清你的问题吗?你有什么样的 PDF 文件,你需要从中提取什么到什么样的 XML 中?您是否被困在此任务的某个特定部分?
-
PDF 文件。我需要从一堆 pdf 文档中提取数据。现在它们没有以任何标准方式格式化,但我知道其中一些是使用 Microsoft excel 生成的,而另一些则不是。但我想将它们转换为 XML,因为我相信 XML 更容易操作。
-
好吧,我有点卡住了。我不知道 IText 中的哪些类可以让我即时将 Pdf 文档转换为 Xml。从到目前为止我收集的示例和信息来看,似乎还有更多关于将 XML / HTML 转换为 PDf 的内容,这与我想要的相反。
-
谷歌搜索“iText 提取”给了我一堆结果,包括这个似乎是教程级别的结果:what-when-how.com/itext-5/parsing-pdfs-part-2-itext-5。 API 文档的这一部分可能也相关:api.itextpdf.com/itext/com/itextpdf/text/pdf/parser/…。最后但同样重要的是,查看 iText in Action 书籍:manning.com/lowagie。 (实际上,对于 iText 问题,您应该首先检查这本书。)
-
另外,请注意从 PDF 中提取文本非常繁琐。很有可能最终不值得付出所需的努力。