【发布时间】:2015-04-08 01:27:12
【问题描述】:
我对scrapy非常陌生。我需要从 URL 的主页跟踪 href 到多个深度。再次在 href 链接中,我有多个 href。我需要遵循这些href,直到我到达我想要的页面来抓取。 我的页面的示例 html 是:
初始页面
<div class="page-categories">
<a class="menu" href="/abc.html">
<a class="menu" href="/def.html">
</div>
abc.html 内
<div class="cell category" >
<div class="cell-text category">
<p class="t">
<a id="cat-24887" href="fgh.html"/>
</p>
</div>
我需要从这个 fgh.html 页面中抓取内容。 谁能建议我从哪里开始。我阅读了有关 Linkextractors 的信息,但找不到合适的参考资料。谢谢你
【问题讨论】:
-
您能否分享指向您正在抓取的实际网站的链接?另外,分享您目前拥有的代码。另外,您怎么知道这是您需要关注的链接:是因为有一个以
cat-开头的id属性吗? -
好吧,我正在刮codecheck.info,我正在尝试其他更简单的教程。如果您能指出一些方法而不是实际的代码,将会非常有帮助。
标签: python web-scraping scrapy scrapy-spider