【问题标题】:crawler4j do not recognize all links on a pagecrawler4j 无法识别页面上的所有链接
【发布时间】:2015-05-11 00:58:28
【问题描述】:

基本上我遇到了一个问题,即 crawler4j 无法识别页面上的所有链接。

例如,页面上存在 5 个链接,其中只有 3 个被识别并因此被提取。其余 2 甚至不被识别。

预期的输出是什么?你看到了什么? 应识别页面中的所有链接,以便获取它们

您使用的是什么版本的产品? crawler4j 4.1

请在下面提供任何其他信息。 我在无法识别的链接中发现的唯一区别是这些链接中有尖括号。

例如。

<a title="some text" href="http://www.example.com/abc/xyz-<sometext>-abc-xyz/abc_xyz" >some text</a>

【问题讨论】:

    标签: crawler4j


    【解决方案1】:

    是的,这似乎是 crawler4j 页面解析器中的一个错误。

    它找到标签,然后搜索右括号 - 这是我假设的失败点。

    请向新的 crawler4j 站点提交问题 - 在 github 上: https://github.com/yasserg/crawler4j/issues

    谢谢

    【讨论】:

      猜你喜欢
      • 2023-03-25
      • 1970-01-01
      • 2019-02-05
      • 1970-01-01
      • 2015-04-15
      • 2011-03-28
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多