【问题标题】:How to stop all search engines, bots to crawl some urls如何停止所有搜索引擎,机器人抓取一些网址
【发布时间】:2012-12-04 10:20:09
【问题描述】:

我想统计小部件上的广告点击次数。

我在robot.txt文件上使用过:

User-agent: *
Allow: /
Disallow: */ads_count/*

我还为该小部件中的所有链接添加了nofollow

但许多机器人仍会遵循该小部件中的网址。我有客户端 ip 来计算 url,我有很多 IP 表单机器人。

【问题讨论】:

    标签: search search-engine bots search-engine-bots


    【解决方案1】:

    您是否尝试删除 */ads_count 之前的 (*)? 正如 SEO 的谷歌文档所说,如果你想阻止所有机器人,就像你做的那样:

    User-agent: * // (to whom? (*) means all bots!
    Disallow: /ads_count
    

    请注意,指令区分大小写。例如,Disallow: /junk_file.asp 会阻止http://www.example.com/junk_file.asp,但会允许http://www.example.com/Junk_file.asp。 Googlebot 将忽略 robots.txt 中的空格(尤其是空行)和未知指令。

    【讨论】:

    • 我的网址前:abc.com/ads_count/?u=213&a=9 所以我尝试禁止所有机器人跟踪所有网址 /ads_count/ 我做错了吗?
    • 尝试添加 User-agent: * Disallow: /ads_count*/ (它应该阻止所有来自 ads_count 的子目录
    • 通常应该没问题,就像你做的那样。如何测试它?
    【解决方案2】:

    AllowDisallow 中的通配符 * 不是原始 robots.txt 规范的一部分,因此并非所有 robots.txt 解析器都会知道/注意到这些规则。

    如果你想屏蔽所有以/ads_count/开头的页面,你只需要:

    User-agent: *
    Disallow: /ads_count/
    

    但是:并非所有机器人都尊重 robots.txt。因此,您仍然会受到忽略 robots.txt 的恶意机器人的攻击。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-02-24
      • 2018-09-25
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2012-06-13
      • 2014-08-25
      • 1970-01-01
      相关资源
      最近更新 更多