【问题标题】:How to replace robots.txt with .htaccess如何用 .htaccess 替换 robots.txt
【发布时间】:2011-09-24 05:33:57
【问题描述】:

我有一个小情况,我必须删除我的 robots.txt 文件,因为我不希望机器人爬虫获取链接。

我还希望用户可以访问它们,并且我不希望它们被搜索引擎缓存。

由于各种原因,我也无法添加任何用户身份验证。

所以我正在考虑使用 mod-rewrite 来禁止搜索引擎爬虫抓取它,同时允许所有其他人这样做。

我试图实现的逻辑是编写一个条件来检查传入的用户代理是否是搜索引擎,如果是,则将它们重定向到 401。

唯一的问题是我不知道如何实现它。 :(

谁能帮帮我。

提前致谢。

问候,

【问题讨论】:

    标签: php .htaccess search-engine robots.txt


    【解决方案1】:

    我可能理解错了,但我认为

    User-agent: *
    Disallow: /
    

    在 robots.txt 中将做你想做的事 - 不让任何爬虫进入,同时保持网站对普通用户开放。

    或者您是否需要专门从网络服务器中删除 robots.txt(出于什么原因?)?

    【讨论】:

    • 它不会绝对阻止所有爬虫停止浏览您的网站(只有那些尊重 robots.txt 的爬虫——所有大型搜索引擎都会这样做).. 但这绝对是一种开始的方式。
    • 没有办法阻止不尊重 robots.txt 的自定义爬虫,因为它们可以发送任何必要的信息,包括“正确的”用户代理。
    • 我完全同意你的看法。这条评论是写给 OP 的,而不是写给你的——我只是觉得把评论留在这里比在问题下面更合适。
    • 我的主要目的是阻止任何爬虫从 robots.txt 获取敏感页面的 url,如果他们手动浏览它或使用直接 url 从它复制,我不会打扰。我只想阻止他们知道这些链接存在于 robots.txt 中,同时如果任何搜索引擎(如 google 或 bing)遇到该链接,我不希望他们缓存或关注它。就是这样。
    猜你喜欢
    • 1970-01-01
    • 2019-12-13
    • 1970-01-01
    • 2012-08-31
    • 2016-04-28
    • 1970-01-01
    • 1970-01-01
    • 2013-07-12
    • 1970-01-01
    相关资源
    最近更新 更多