【问题标题】:Why google finds a page excluded by robots.txt?为什么 google 会发现 robots.txt 排除的页面?
【发布时间】:2013-11-07 13:35:49
【问题描述】:

我正在使用 robots.txt 从蜘蛛中排除一些页面。

User-agent: * 
Disallow: /track.php

当我搜索引用到此页面的内容时,谷歌说:“由于此站点的 robots.txt,因此无法获得此结果的描述 - 了解更多信息。”

这意味着 robots.txt 正在运行.. 但是为什么蜘蛛仍然找到该页面的链接?我想没有指向“track.php”页面的链接......我应该如何设置 robots.txt? (或类似 .htaccess 之类的东西..?)

【问题讨论】:

  • 如果您访问domain.com/robots.txt,您会看到您的 robots.txt 还是 404 页面?
  • 我看到了 robots.txt!

标签: .htaccess robots.txt web-crawler


【解决方案1】:

事情是这样的:

  • Googlebot 在其他页面上看到了 track.php 的链接。让我们将该页面称为“source.html”。
  • Googlebot 试图访问您的 track.php 文件。
  • 您的 robots.txt 告诉 Googlebot 不要读取该文件。

所以 Google 知道 source.html 链接到 track.php,但它不知道 track.php 包含什么。你没有告诉谷歌不要索引 track.php;您告诉 Googlebot 不要读取和索引 inside track.php 的数据。

作为Google's documentation says:

虽然 Google 不会抓取 robots.txt 阻止的网页内容或将其编入索引,但如果我们在网络上的其他网页上找到这些网址,我们仍可能会将其编入索引。因此,页面的 URL 以及其他公开可用的信息(例如指向该站点的链接中的锚文本或来自 Open Directory Project (www.dmoz.org) 的标题)可能会出现在 Google 搜索结果中。

您对此无能为力。对于您自己的页面,您可以使用该文档中所述的x-robots-tagnoindex meta tag。如果 Googlebot 在您的网页中找到链接,这将阻止 Googlebot 将 URL 编入索引。但是,如果某些您不控制的页面链接到该 track.php 文件,那么 Google 很可能会将其编入索引。

【讨论】:

  • 很好的解释,我刚刚读到了..我会尝试使用 noindex! (希望没有人链接该页面)。谢谢
  • 我看到“noindex”只能与元标记一起使用,因此它将从索引中排除该页面中的所有链接。我会尝试使用 .. 可以吗?
  • @AlbertoFecchi:“它会起作用吗?”我不知道。谷歌的文档对此并不清楚。我建议你换个页面然后request that Google remove the link from their index.
猜你喜欢
  • 2012-01-16
  • 1970-01-01
  • 2019-03-11
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-02-24
  • 1970-01-01
  • 2012-09-06
相关资源
最近更新 更多