【问题标题】:Having problems understanding how to block some URLs on robot.txt在理解如何阻止 robots.txt 上的某些 URL 时遇到问题
【发布时间】:2013-06-28 02:02:31
【问题描述】:

问题是这样的。我的系统上有一些具有这种模式的 URL

http://foo-editable.mydomain.com/menu1/option2
http://bar-editable.mydomain.com/menu3/option1

我想在 robots.txt 文件中指出它们不应被抓取。但是,我不确定这种模式是否正确:

User-agent: Googlebot 
Disallow: -editable.mydomain.com/*

它会按我的预期工作吗?

【问题讨论】:

    标签: web robots.txt googlebot


    【解决方案1】:

    您不能在 robots.txt 文件中指定域或子域。给定的 robots.txt 文件仅适用于加载它的子域。阻止某些子域而不阻止其他子域的唯一方法是为不同的子域提供不同的 robots.txt 文件。

    例如,在文件http://foo-editable.mydomain.com/robots.txt 你会:

    User-agent: Googlebot
    Disallow: /
    

    http://www.mydomain.com/robots.txt 你可以:

    User-agent: *
    Allow: /
    

    (或者您根本无法在 www 子域上拥有 robots.txt 文件)

    如果您的配置不允许您为不同的子域提供不同的 robots.txt 文件,您可以寻找替代方案,例如 robots 元标记或 X-robots-tag 响应标头。

    【讨论】:

      【解决方案2】:

      我认为你必须这样编码。

      User-agent: googlebot 
      Disallow: /*-editable.mydomain.com/
      

      不能保证任何机器人都会处理asterisk as a wild card,但我认为 googlebot 会。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2016-02-03
        • 1970-01-01
        • 2015-05-15
        • 1970-01-01
        • 2019-01-03
        • 2023-04-02
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多