【问题标题】:JSoup handles only a fraction of HTML pages rightJSoup 只处理一小部分 HTML 页面
【发布时间】:2019-07-09 18:33:07
【问题描述】:

我讨厌垄断这个论坛,但是一开始有很多问题......

JSoup 只能正确处理 Web 上找到的一小部分(绝对小于 50%)的 HTML 页面并在其中发现新的 url 是否正常?这就是我的种子文件所发生的事情,令人沮丧。

或者有没有更好的解析器可以使用?

问候

【问题讨论】:

  • 很难相信像jsoup 这样具有超过 1,000 次提交的成熟 HTML 解析器项目的性能会如此糟糕。你能分享例子和详细的指标吗?但是,我的猜测是您想要进行解析,包括通过 JavaScript 完成的所有页面依赖项和 DOM 树的修改。看看 SeleniumProtocol。与只解析纯 HTML 页面相比,结果可能看起来不同。

标签: web-crawler apache-storm stormcrawler


【解决方案1】:

检查 http.content.limit 的值。可能是因为文档被截断,您得到了部分结果。

编辑:也许试试DebugParseFilter 看看JSoup 生成的DOM 是什么样子的。就像 Sebastian 建议的那样,它可能与 JS 相关。

【讨论】:

  • 感谢您的提示。它目前设置为 2 MB,并且我检查了相关文档是否大大低于此限制...
  • 谢谢,我正在尝试。它到底把DOMDump.xml放在哪里了?
猜你喜欢
  • 2012-10-29
  • 1970-01-01
  • 2011-08-27
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多