【发布时间】:2019-07-09 18:33:07
【问题描述】:
我讨厌垄断这个论坛,但是一开始有很多问题......
JSoup 只能正确处理 Web 上找到的一小部分(绝对小于 50%)的 HTML 页面并在其中发现新的 url 是否正常?这就是我的种子文件所发生的事情,令人沮丧。
或者有没有更好的解析器可以使用?
问候
【问题讨论】:
-
很难相信像jsoup 这样具有超过 1,000 次提交的成熟 HTML 解析器项目的性能会如此糟糕。你能分享例子和详细的指标吗?但是,我的猜测是您想要进行解析,包括通过 JavaScript 完成的所有页面依赖项和 DOM 树的修改。看看 SeleniumProtocol。与只解析纯 HTML 页面相比,结果可能看起来不同。
标签: web-crawler apache-storm stormcrawler