【问题标题】:Robots.txt and secret URL ?xx=xxRobots.txt 和秘密 URL ?xx=xx
【发布时间】:2014-07-23 00:53:21
【问题描述】:

我有一个不同的秘密 URL 与 ?id=123?id=567example.com/123,我需要阻止除我的主页之外的所有这些 URL,但我对 Disallow: /* 有疑问:它只适用于 Google。

我的第一个 robots.txt(被 Google 屏蔽)

User-Agent: * 
Allow: /
Disallow: /$

实际上我已将example.com/123 替换为example.com/?id=123,因为$ 不起作用,我使用了

User-Agent: * 
Allow: /
Disallow: /?id=

我已经加了meta-robots

$robotIndex = "index,nofollow";
if(!empty($_GET)) {
    $robotIndex = "noindex,nofollow";
}

正确吗?禁止除主页以外的所有页面的语法是什么?

【问题讨论】:

  • 无论您在页面上或 robots.txt 文件中放置什么内容,一些机器人都会抓取它们可以找到的任何页面。

标签: robots.txt


【解决方案1】:

最近,Google 在网站管理员工具(抓取部分)中提供了 robots.txt 测试工具。您可以添加规则并针对它测试 URL。这样您就可以测试您的配置是否正常工作。

此外,在抓取部分下,您有 URL 参数选项。您可以设置 URL 中的参数如何以及是否更改页面内容,以及是否应将这些 URL 编入索引。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-04-06
    • 2011-12-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多