【发布时间】:2019-03-22 10:48:22
【问题描述】:
我昨天发现 Scrapy 默认尊重 robots.txt 文件 (ROBOTSTXT_OBEY = True)。
如果我请求一个带有scrapy shell url 的URL,并且如果我有响应,是否意味着url 不受robots.txt 保护?
【问题讨论】:
标签: scrapy robots.txt
我昨天发现 Scrapy 默认尊重 robots.txt 文件 (ROBOTSTXT_OBEY = True)。
如果我请求一个带有scrapy shell url 的URL,并且如果我有响应,是否意味着url 不受robots.txt 保护?
【问题讨论】:
标签: scrapy robots.txt
根据文档,仅当您使用scrapy startproject 命令创建项目时默认启用它,否则应默认为False。
https://docs.scrapy.org/en/latest/topics/settings.html#robotstxt-obey https://docs.scrapy.org/en/latest/topics/downloader-middleware.html#topics-dlmw-robots
回答您的问题,是的,scrapy shell 命令确实尊重settings.py 中定义的robots.txt 配置。如果是ROBOTSTXT_OBEY = True,尝试在受保护的 URL 上使用 scrapy shell 命令将生成响应 None。
您也可以通过命令行通过 robots.txt 设置对其进行测试:
scrapy shell https://www.netflix.com --set="ROBOTSTXT_OBEY=True"
【讨论】: