【发布时间】:2010-10-23 21:00:40
【问题描述】:
我使用 htmlparser 1.6 来解析网站。
问题是当我解析 pdf 网站时,我在输出文件中获得了奇怪的字符,比如
ØÇÁÖÜ/:?ÖQØ?WÕWÏ
这是我的代码片段:
try {
parser = new Parser ();
if (1 < args.length)
filter = new TagNameFilter (args[1]);
else
{
filter = null;
parser.setFeedback (Parser.STDOUT);
Parser.getConnectionManager ().setMonitor (parser);
}
Parser.getConnectionManager ().setRedirectionProcessingEnabled (true);
Parser.getConnectionManager ().setCookieProcessingEnabled (true);
// Here the pdf web site
parser.setResource ("http://hal.archives-ouvertes.fr" +
"/docs/00/16/76/78/PDF /27_Bendaoud.pdf");
NodeList list = parser.parse(filter);
NodeIterator i = list.elements ();
while (i.hasMoreNodes ())
processMyNodes(i.nextNode ());
}
catch (EncodingChangeException ece) {
try {
parser.reset ();
NodeList list = parser.parse(filter);
for (NodeIterator i = list.elements (); i.hasMoreNodes (); )
processMyNodes (i.nextNode ());
}
catch (ParserException e) {
e.printStackTrace ();
}
}
catch (ParserException e) {
e.printStackTrace ();
}
更新:
我使用 iText 来解析 PDF 文件。它适用于本地文件,但我想解析托管在 Web 服务器中的 PDF 文件,例如这个:
http://protege.stanford.edu/publications/ontology_development/ontology101.pdf"
如何使用 iText 或其他库来完成这项任务?
【问题讨论】:
-
如果 1/ 格式化代码提取,并且 2/ 提供更多详细信息(代码语言、指向 htmlparser 的链接...),您很可能会得到答案
-
嗯,pdf 不是 html,因此我不希望 htmlparser 以任何方式解析它们。