【问题标题】:Google still indexing unique URLs谷歌仍在索引唯一的 URL
【发布时间】:2015-07-16 17:48:29
【问题描述】:

我设置了一个 robots.txt 文件

User-agent: *
Disallow: /*

对于一个完全基于唯一 URL 的网站。有点像https://jsfiddle.net/,当你保存一个新的小提琴时,它会给它一个唯一的 URL。我希望我的所有唯一 URL 对 Google 不可见。没有索引。

Google 已将我的所有唯一网址编入索引,即使它说“由于该网站的 robots.txt 文件,无法提供此结果的说明。-了解详情”

但这仍然很糟糕,因为所有 URL 都在那里,并且可以点击 - 所以里面的所有数据都是可用的。我能做些什么来 1) 从 Google 中删除这些内容,以及 2) 阻止 Google 将这些 URL 编入索引。

【问题讨论】:

    标签: indexing robots.txt google-search-console


    【解决方案1】:

    Robots.txt 告诉搜索引擎不要抓取该页面,但它不会阻止它们将页面编入索引,尤其是当有来自其他网站的页面链接时。如果您的主要目标是保证这些页面永远不会出现在搜索结果中,您应该改用robots meta tags。带有“noindex”的机器人元标记表示“根本不索引此页面”。在 robots.txt 中屏蔽该页面意味着“不要从服务器请求此页面。”

    添加漫游器元标记后,您需要更改 robots.txt 文件以不再禁止这些网页。否则,robots.txt 文件会阻止爬虫加载页面,从而阻止它查看元标记。在您的情况下,您只需将 robots.txt 文件更改为:

    User-agent: *
    Disallow:
    

    (或完全删除 robots.txt 文件)

    如果机器人元标记由于某种原因不是一个选项,您也可以使用 X-Robots-Tag 标头来完成同样的事情。

    【讨论】:

    • 啊太棒了!您能否详细说明“从 robots.txt 中删除页面”是否有语法?大概有 4000 页
    • 您只需要更改 robots.txt 以不再阻止页面。在您的情况下,这是一个简单的单行更改。我已经编辑了答案以澄清。
    • 然后给谷歌一周左右的时间?
    • 至少给它几个星期。您需要让 Google 有时间注意到 robots.txt 的更改,然后抓取每个已编入索引的页面,然后从其索引中删除每个页面。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-12-20
    • 2017-03-28
    • 1970-01-01
    • 2018-03-05
    • 2013-02-27
    相关资源
    最近更新 更多