【发布时间】:2015-05-11 00:58:28
【问题描述】:
基本上我遇到了一个问题,即 crawler4j 无法识别页面上的所有链接。
例如,页面上存在 5 个链接,其中只有 3 个被识别并因此被提取。其余 2 甚至不被识别。
预期的输出是什么?你看到了什么? 应识别页面中的所有链接,以便获取它们
您使用的是什么版本的产品? crawler4j 4.1
请在下面提供任何其他信息。 我在无法识别的链接中发现的唯一区别是这些链接中有尖括号。
例如。
<a title="some text" href="http://www.example.com/abc/xyz-<sometext>-abc-xyz/abc_xyz" >some text</a>
【问题讨论】:
标签: crawler4j