【问题标题】:Disallow pagination from being indexed禁止分页被索引
【发布时间】:2012-12-27 20:43:08
【问题描述】:

我有一个包含 1000 多个页面的 joomla 网站,其中包含如下网址:

www.mysite.com/example.html?start=10  
www.mysite.com/example.html?start=20  
www.mysite.com/example.html?limitstart=0  

所有这些 URL 都被谷歌索引,在谷歌网站管理员工具中,我有大量由这些分页引起的重复元描述。

我知道使用 robots.txt 阻止他们并不难,这就是我需要帮助的原因。

【问题讨论】:

    标签: joomla pagination robots.txt


    【解决方案1】:

    您可以创建一个robot.txt 并使用Disallow 属性。

    例如,既然你提到了这 3 个 url:

    www.mysite.com/example.html?start=10  
    www.mysite.com/example.html?start=20  
    www.mysite.com/example.html?limitstart=0
    

    你应该使用这个:

    Disallow: /?start=
    Disallow: /?limitstart=
    

    您必须使用 Disallow: 后跟 / 以及包含在您想要禁止的内容中的模式。它可以针对特定的文件或文件夹。

    您还可以使用 User-agent 属性指定要将文件或文件夹隐藏到哪些机器人:

    User-agent: *
    Disallow: /?start=
    Disallow: /?limitstart=
    

    上面的代码适用于任何机器人或抓取引擎。

    User-agent: googlebot
    Disallow: /?start=
    Disallow: /?limitstart=
    

    例如,此代码仅适用于 Google。

    作为参考,您可以阅读您在www.robotstxt.org 上找到的材料,或者维基百科也有一个足够好的页面。 http://en.wikipedia.org/wiki/Robots.txt

    另一个详细的参考可以在这里找到:https://developers.google.com/webmasters/control-crawl-index/docs/robots_txt

    【讨论】:

    • 感谢您的帮助
    • 不客气。如果您对我的回答感到满意,您可以投票赞成我的回答并将我的回答设置为“接受的答案”。 @NiceOne
    • 您的 robots.txt 有误。 Disallow: /start 规则 从不 阻止像 example.com/example.html?start=10 这样的 URL。它只会阻止 example.com/startexample.com/startfoobar 等 URL。
    • 请教你的建议,如果错了,我应该放什么而不是 Disallow: /start ?
    • 我编辑了答案。现在应该没问题了。检查我添加的最后一个链接。我以此为基础回答。 @NiceOne
    【解决方案2】:

    正确答案是:

    用户代理:*

    不允许:/*?start=

    不允许:/*?limitstart=

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2013-09-03
      • 2020-11-26
      • 2018-10-16
      • 2016-06-19
      • 2019-04-28
      • 1970-01-01
      • 2015-07-16
      相关资源
      最近更新 更多