【问题标题】:robots.txt Disallow: /click What is disallowed?robots.txt Disallow: /click 什么是不允许的?
【发布时间】:2013-01-15 22:30:21
【问题描述】:

我想抓取一个网站。它的 robots.txt 文件中有以下内容,但我不确定他们不希望我做什么:

User-agent: *
Disallow: /click

没有点击子目录。或者他们不希望我访问通常需要单击的任何内容(例如通过表单提交数据)?在任何情况下,他们肯定不会让事情变得容易 - 主页的表单获取到设置由第三页读取的 cookie 的站点。

【问题讨论】:

    标签: web-crawler robots.txt


    【解决方案1】:

    这意味着没有机器人应该抓取任何路径字符串click开头的URL。

    例如,应阻止以下 URL:

    • example.com/click
    • example.com/click.html
    • example.com/click/
    • example.com/click/foo/bar
    • example.com/clicker

    以下网址仍将被允许:

    • example.com/foo/click
    • example.com/fooclick
    • example.com/clic

    您可以在 http://www.robotstxt.org/wc/robots.html 找到原始 robots.txt 规范。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2023-04-07
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-06-13
      • 2011-11-01
      • 2011-08-17
      相关资源
      最近更新 更多