【问题标题】:Scrapy Follow & Scrape next PagesScrapy 关注并抓取下一页
【发布时间】:2015-05-02 13:28:09
【问题描述】:

我遇到了一个问题,我的爬虫蜘蛛都不会爬取网站,只需爬取一页并抓住。我的印象是 rules 成员变量对此负责,但我无法让它跟随任何链接。我一直在关注这里的文档:http://doc.scrapy.org/en/latest/topics/spiders.html#crawlspider

我可能缺少什么让我的机器人都无法爬行?

from scrapy.contrib.spiders import CrawlSpider, Rule
from scrapy.contrib.linkextractors import LinkExtractor
from scrapy.selector import Selector

from Example.items import ExItem

class ExampleSpider(CrawlSpider):
    name = "example"
    allowed_domains = ["example.ac.uk"]
    start_urls = (
        'http://www.example.ac.uk',
    )

    rules = ( Rule (LinkExtractor(allow=("", ),),
                    callback="parse_items",  follow= True),
    )

【问题讨论】:

  • 您有任何错误吗?您可以发布您要抓取的网站的实际链接吗?
  • 不,完全没有错误。解析项目功能也可以正常工作。
  • 可以发一下网址吗?
  • 我刚试过你的代码,它对我来说很好用。能发一下日志吗?
  • ...我想你不明白。它工作正常,只是不会转到下一页并开始抓取。无论如何感谢您的帮助

标签: python python-2.7 web-scraping scrapy


【解决方案1】:

用这个替换你的规则:

rules = ( Rule(LinkExtractor(allow=('course-finder', ),restrict_xpaths=('//div[@class="pagination"]',)), callback='parse_items',follow=True), )

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2015-12-13
    • 2021-06-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-04-08
    • 2014-03-20
    相关资源
    最近更新 更多