【发布时间】:2014-03-27 18:02:36
【问题描述】:
我有几个 PDF 文件,我无法从中提取文本。这些 PDF 文件是通过将 Word 文件转换为 PDF 来创建的。 我从pdf中提取文本的主要目的是索引其文本并使其可搜索。
PdfReader reader = new PdfReader(inFileName);
for (int page = 1; page <= reader.NumberOfPages; page++)
{
// where strPDFText is string builder
strPDFText.Append(iTextSharp.text.pdf.parser.PdfTextExtractor.GetTextFromPage(reader, page) + " ");
}
string str = strPDFText.ToString();
我得到一个空字符串。相同的原因可能是什么。我正在使用 Itextsharp 5.5
【问题讨论】:
-
请分享有问题的 PDF。
-
你能给我你的emailId,我会转发到Email ID。
-
请查看我的个人资料。话虽如此,为了让参与者有更多机会检查文件,通常首选共享文件(例如使用公共 Dropbox 或 Google 共享)。
-
这是有问题的示例 pdf。 drive.google.com/file/d/0B4QBm7z507k_MWU4QTFoM2M5b1U/…
标签: itextsharp