【问题标题】:Google search results showing my site even though I've disallowed it in robots.txt [closed]谷歌搜索结果显示我的网站,即使我在 robots.txt 中禁止它[关闭]
【发布时间】:2013-03-29 19:40:19
【问题描述】:

我的暂存站点显示在搜索结果中,即使我已指定我不希望该站点被抓取。这是暂存站点的 robots.txt 文件的内容:

User-agent: Mozilla/4.0 (compatible; ISYS Web Spider 9)
Disallow:

User-agent: *
Disallow: /

我在这里做错了吗?

【问题讨论】:

  • Google 将 robots.txt 缓存了几天,有时长达一周,根据他们的网站。你不能指望你今天所做的改变会立即得到体现。另外,请查看 Google 的帮助页面 support.google.com/webmasters/bin/…,尤其是最后一部分。

标签: seo robots.txt


【解决方案1】:

您的 robots.txt 告诉 Google 不要抓取/索引您网页的内容。

它并没有告诉 Google 不要将您的网址添加到他们的搜索结果中。

因此,如果您的网页(被 robots.txt 阻止)链接到其他地方,并且 Google 找到了此链接,它会检查您的 robots.txt 是否允许抓取。它发现它是被禁止的,但是,它仍然有你的URL。

现在,Google 可能会决定将此 URL 包含在其搜索索引中会很有用。但由于不允许他们(根据您的 robots.txt)获取页面的元数据/内容,因此他们只能使用来自您的 URL 本身的关键字以及可能其他人用来链接到您的页面的锚/标题文本对其进行索引。

如果您不希望 Google 将您的网址编入索引,则需要使用 meta-robots,例如:

 <meta name="robots" content="noindex">

请参阅 Google 的文档:Using meta tags to block access to your site

【讨论】:

    【解决方案2】:

    您的 robots 文件看起来很干净,但请记住 Google、Yahoo、Bing 等不需要抓取您的网站以将其编入索引。

    很有可能Open Directory Project 或某种不那么礼貌的礼貌 机器人偶然发现了它。如今,一旦其他人找到您的网站,似乎每个人都可以使用它。也让我发疯。

    暂存时的一个好的经验法则是:

    1. 在将 robots 文件发布到您的生产站点之前,请始终测试您的 robots 文件是否存在与语法相关的任何疏忽。试试robots.txt CheckerAnalyze robots.txtRobots.txt Analysis - Check whether your site can be accessed by Robots

    2. 登台时使用密码保护您的内容。即使它有些虚假,也要在索引根目录下输入登录名和密码。对于你的粉丝和测试人员来说,这是一个额外的步骤——但如果你想要礼貌——或者——不礼貌的机器人,这是非常值得的。

    3.根据项目,您可能不想使用您的实际域进行测试。即使我有一个静态 IP - 有时我会使用 dnsdynamicnoip.com 来展示我受密码保护的网站。例如,如果我想暂存我的域 ihatebots.com :) 我将简单地转到 dnsdynamic 或 noip(它们是免费的顺便说一句)并创建一个假域,例如:ihatebots.user32 .comsomthingtotallyrandom.user32.com,然后将我的 IP 地址分配给它。这样,即使有人抓取了我的临时项目——我的原始域:ihatebots.com 仍然不受任何类型的搜索引擎结果的影响(顺便说一句,它的记录也是如此)。

    请记住,全世界有数十亿美元旨在全天 24 小时寻找您,而且这个数字还在不断增加。这几天很艰难。如果可以,请在登台时发挥创意并始终使用密码保护。

    祝你好运。

    【讨论】:

      猜你喜欢
      • 2016-09-16
      • 2011-08-06
      • 2014-05-04
      • 1970-01-01
      • 2011-02-27
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多