【发布时间】:2013-03-26 16:21:35
【问题描述】:
使用 JSoup (包括最新版本 1.7.2)在解析 invalid HTML with unclosed tags 时存在错误。
例子:
String tmp = "<a href='www.google.com'>Link<p>Error link</a>";
Jsoup.parse(tmp);
生成的文档是:
<html>
<head></head>
<body>
<a href="www.google.com">Link</a>
<p><a>Error link</a></p>
</body>
</html>
浏览器会生成如下内容:
<html>
<head></head>
<body>
<a href="www.google.com">Link</a>
<p><a href="www.google.com">Error link</a></p>
</body>
</html>
Jsoup 应该作为浏览器或源代码工作。
有什么解决办法吗?查看 API 我没有找到任何东西。
【问题讨论】:
标签: java html-parsing web-crawler jsoup