【发布时间】:2012-11-05 17:06:07
【问题描述】:
有没有办法确定 PDF 文件的类型:现有 PDF 文件是扫描图像还是使用 iTextSharp 和 C# 从数据文件创建的?
【问题讨论】:
-
您的标准是什么?您如何区分来自扫描仪的 PDF 和其他类型的文档?是打印的字符数量吗?是图像覆盖的页面面积吗?它是创建 PDF 的程序的名称吗? iTextSharp 可以帮助您确定这些值,但您必须事先提出标准。
-
“你如何区分来自扫描仪的 PDF...” - 你甚至不能选择文本
-
嗯,不一定是这样。有些扫描解决方案会执行一些额外的 OCR,然后通过不可见但可选择的文本来丰富扫描的 PDF。另一方面,使用 iTextSharp 和 C# 从数据文件创建 PDF 很容易,而没有任何可选择的文本。那么,我能否解释您的问题,以便您真正想要区分带有可选文本的 PDF 和没有可选文本的 PDF?
-
@ESB PdfTextExtractor.GetTextFromPage() 可以帮助您找出它是否包含任何文本。
标签: c# pdf itextsharp