【发布时间】:2012-12-19 22:00:39
【问题描述】:
我正在尝试从给定 Xpath 的文件中获取 html 代码。我尝试使用 HTMLUnit,但从谷歌缓存下载的这些静态文件似乎不太好。我对 HTMLCleaner 的运气要好一些,但到目前为止,我只能获得文本而没有 HTML 代码。任何的意见都将会有帮助。以下是我目前使用的代码。
TagNode tagNode = new HtmlCleaner().clean(readFile(htmlCacheFile));
Document doc = new DomSerializer(new CleanerProperties()).createDOM(tagNode);
XPath xpath = XPathFactory.newInstance().newXPath();
String title = ((String) xpath.evaluate(TITLE_XPATH, doc, XPathConstants.STRING)).trim();
String body = ((String) xpath.evaluate(BODY_XPATH, doc, XPathConstants.STRING)).trim();
【问题讨论】:
标签: java parsing html-parsing htmlunit htmlcleaner