【问题标题】:How to identify a section of a PDF in iTextSharp?如何在 iTextSharp 中识别 PDF 的一部分?
【发布时间】:2016-03-01 21:16:14
【问题描述】:

我想知道是否可以通过其部分(页眉、正文、页脚等)检索 PDF 中的文本我能够获取文本及其特定坐标,但我不想定义我自己的 x和截面的 y 坐标。我想知道是否有更动态的方法来解决这个问题。 也许循环通过外部参照对象。任何帮助将不胜感激。提前致谢。

【问题讨论】:

  • 通用 PDF 不包含关于什么是页眉、页脚、正文的显式信息,它只知道在特定坐标处绘制的文本和图形,您可以尝试分析给定的隐式信息,例如通过字体、字体大小、对齐方式、间隙等。pp。但这本身就是一个项目。

标签: c# loops pdf itextsharp sections


【解决方案1】:

除非您的 PDF 文件是由非常一致的来源创建的,并且您不必处理“一般的 PDF 文件”,否则您的问题的答案是:

  • 不,你不能轻易做到这一点
  • 但您可以提出一种动态方法(也许)。

PDF 没有任何规定来构造其内容,例如 XML、HTML、Word 等... 不存在页眉、正文、页脚的概念。甚至段落、行或单词的概念都不存在。 PDF 只对确保特定字符(字形)显示在特定位置感兴趣。

因此,如果您想提出一种动态方法,则必须编写一种算法来分析页面上所有文本的文本位置,并将其与该文本的其他属性(例如使用的字体、字体大小、颜色、样式...),并根据该分析推测页眉、正文和页脚是什么。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2016-07-29
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-08-18
    • 2018-04-19
    • 1970-01-01
    相关资源
    最近更新 更多