【问题标题】:Scrapy and respect of robots.txt刮痧和尊重robots.txt
【发布时间】:2019-03-22 10:48:22
【问题描述】:

我昨天发现 Scrapy 默认尊重 robots.txt 文件 (ROBOTSTXT_OBEY = True)。

如果我请求一个带有scrapy shell url 的URL,并且如果我有响应,是否意味着url 不受robots.txt 保护?

【问题讨论】:

    标签: scrapy robots.txt


    【解决方案1】:

    根据文档,仅当您使用scrapy startproject 命令创建项目时默认启用它,否则应默认为False

    https://docs.scrapy.org/en/latest/topics/settings.html#robotstxt-obey https://docs.scrapy.org/en/latest/topics/downloader-middleware.html#topics-dlmw-robots

    回答您的问题,是的,scrapy shell 命令确实尊重settings.py 中定义的robots.txt 配置。如果是ROBOTSTXT_OBEY = True,尝试在受保护的 URL 上使用 scrapy shell 命令将生成响应 None

    您也可以通过命令行通过 robots.txt 设置对其进行测试:

    scrapy shell https://www.netflix.com --set="ROBOTSTXT_OBEY=True"
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2020-03-14
      • 1970-01-01
      • 2016-01-25
      • 2022-01-14
      • 1970-01-01
      • 1970-01-01
      • 2022-08-20
      相关资源
      最近更新 更多