【发布时间】:2018-01-16 13:44:22
【问题描述】:
我知道有人提出并回答了类似的问题,但我找不到解决问题的方法。 所以基本上我想使用 C# 从在线 pdf 文件中提取文本,我可以使用 [itextsharp] 库来实现。然而,这适用于我可以通过在谷歌上搜索找到的一些随机 pdf 文件。我的目标是对存储多个 PDF 文件的私人共享点帐户执行相同的操作。我的 chrome 网络浏览器设置为记住用户和密码,但我仍然无法用我的代码实现它。对我来说,身份验证似乎没有问题,但我可能错了。代码如下:
public static string pdfTX(string path)
{
CookieContainer cookieJar = new CookieContainer();
HttpWebRequest request = (HttpWebRequest)WebRequest.Create(path);
request.Proxy.Credentials = CredentialCache.DefaultCredentials;
request.UserAgent = @"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/51.0.2704.106 Safari/537.36";
request.Credentials = CredentialCache.DefaultCredentials;
// request.Credentials = new NetworkCredential(uName, pWord);
Thread.Sleep(3000);
HttpWebResponse response = (HttpWebResponse)request.GetResponse();
Stream stream = request.GetResponse().GetResponseStream();
string textPDF = string.Empty;
PdfReader reader = new PdfReader(stream); //error here (iTextSharp.text.exceptions.InvalidPdfException: 'PDF header signature not found.')
for (int page = 1; page <= reader.NumberOfPages; page++)
{
textPDF += PdfTextExtractor.GetTextFromPage(reader, page);
}
reader.Close();
response.Close();
// readStream.Close();
// public string passtext = text;
return textPDF;
}
我很乐意提供任何帮助或信息! 感谢您的时间和精力!
【问题讨论】:
标签: c# pdf sharepoint text extract