【问题标题】:Want to understand Robots.txt想了解 Robots.txt
【发布时间】:2019-09-22 14:21:01
【问题描述】:

我想抓取一个网站。但是,我想先了解 robots.txt。 看不懂的台词是

User-agent: *
Disallow: /*/*/*/*/*/*/*/*/
Disallow: /*?&*&*
Disallow: /*?*&*
Disallow: /*|*

用户代理行是否意味着任何地方都可以访问?但是后来我有了 Disallow 行,这是我关心的主要行。这是否意味着不访问 8 层深度,或者根本不访问?

【问题讨论】:

标签: web-scraping scrapy scrapinghub


【解决方案1】:

我相信人们只需将robot.txt 文件解释为regex。星星通常可以解释为任何东西/所有东西

User-Agent 行User-agent: * 并不意味着您可以抓取所有内容,它只是表示以下规则适用于所有用户代理。以下是用户代理的示例

# Chrome Browser
Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/76.0.3809.132 Safari/537.36
# Python requests default
python-requests/2.19.1

必须遵守相同的规则,即:

  • 例如Disallow: /*?*&* 表示您不允许抓取/some_sub_domain?param_name=param_value 形式的子域。

  • 或者/*/*/*/*/*/*/*/*/这行表示下面表格的子域不允许被刮/a/b/c/d/e/f/g/i/

最后,here are insightful examples 和更多关于该主题的内容。

【讨论】:

  • 太棒了——所以多层不是包罗万象,而是与特定形式的地址有关?
猜你喜欢
  • 2015-01-22
  • 2020-02-08
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多