【问题标题】:Convert PDF Document to XML file, preferably using ITextSharp将 PDF 文档转换为 XML 文件,最好使用 ITextSharp
【发布时间】:2012-06-21 22:04:12
【问题描述】:

我有一个 PDF 文档,我需要从中读取数据。我发现,当我将所述 PDF 转换为 XML 文档时,我可以从中读取方便的标签,因此我需要一种在代码中将文件转换为 xml 的方法,这样我就可以使用映射器文件读取数据内容到数据库。

【问题讨论】:

  • 我的“太宽泛”的感觉有点刺痛。你能试着澄清你的问题吗?你有什么样的 PDF 文件,你需要从中提取什么到什么样的 XML 中?您是否被困在此任务的某个特定部分?
  • PDF 文件。我需要从一堆 pdf 文档中提取数据。现在它们没有以任何标准方式格式化,但我知道其中一些是使用 Microsoft excel 生成的,而另一些则不是。但我想将它们转换为 XML,因为我相信 XML 更容易操作。
  • 好吧,我有点卡住了。我不知道 IText 中的哪些类可以让我即时将 Pdf 文档转换为 Xml。从到目前为止我收集的示例和信息来看,似乎还有更多关于将 XML / HTML 转换为 PDf 的内容,这与我想要的相反。
  • 谷歌搜索“iText 提取”给了我一堆结果,包括这个似乎是教程级别的结果:what-when-how.com/itext-5/parsing-pdfs-part-2-itext-5。 API 文档的这一部分可能也相关:api.itextpdf.com/itext/com/itextpdf/text/pdf/parser/…。最后但同样重要的是,查看 iText in Action 书籍:manning.com/lowagie。 (实际上,对于 iText 问题,您应该首先检查这本书。)
  • 另外,请注意从 PDF 中提取文本非常繁琐。很有可能最终不值得付出所需的努力。

标签: c# xml pdf itext


【解决方案1】:

使用PDFMiner

PDFMiner 是一个从 PDF 文档中提取信息的工具。它包括一个 PDF 转换器,可以将 PDF 文件转换为其他文本格式(例如 XML/HTML)。

与其他 PDF 相关工具不同,它完全专注于获取和分析文本数据。 PDFMiner 允许获取页面中文本的确切位置,以及字体或线条等其他信息。

它有一个可扩展的 PDF 解析器,可用于文本分析以外的其他目的。

【讨论】:

    猜你喜欢
    • 2011-01-22
    • 2015-03-21
    • 2011-05-22
    • 1970-01-01
    • 1970-01-01
    • 2012-04-24
    • 1970-01-01
    • 1970-01-01
    • 2011-02-16
    相关资源
    最近更新 更多