【发布时间】:2016-11-04 13:02:42
【问题描述】:
我需要使用 scrapy 抓取页面的所有内部网络链接,例如 www.stackovflow.com 上的所有链接都会被抓取。这段代码的工作:
extractor = LinkExtractor(allow_domains=self.getBase(self.startDomain))
for link in extractor.extract_links(response):
self.registerUrl(link.url)
但是有一个小问题,所有相对路径(例如 /meta 或 /questions/ask)都不会被抓取,因为它们不包含基域 stackoverflow.com。任何想法如何解决这一问题?
【问题讨论】:
-
不做 scrapy.spidermiddlewares.offsite.OffsiteMiddleware doc.scrapy.org/en/latest/topics/… 这样做吗?
-
谢谢,我显然找到了一些旧文档