【问题标题】:Request bot to reparse robots.txt请求机器人重新解析 robots.txt
【发布时间】:2012-01-15 20:41:20
【问题描述】:

我正在编写一个代理服务器,将 youtube.com 映射到另一个域(因此用户可以轻松地从德国等国家/地区访问 youtube,而无需审查搜索结果和视频)。

不幸的是,我的robots.txt 中有一个错误。它现在修复了,但是百度蜘蛛得到了我的旧 robots.txt,并且几天来一直试图索引整个网站。 因为 Youtube 是一个相当大的网站,我认为这个过程不会很快结束 :-)

我已经尝试将 baiduspider 重定向到另一个页面并向其发送 404,但它已经解析到许多路径。

对此我能做些什么?

【问题讨论】:

  • 您是否尝试联系他们 (ir.baidu.com/phoenix.zhtml?c=188488&p=irol-inforeq)?网址怎么样?
  • 好的,谢谢,我联系了他们,域名是 mybaer.com(它目前将每个请求重定向到 /robots.txt)
  • 无论如何,它认为我会让baiduspider发出他愚蠢的http请求,我不必处理它们,也许有一天它会重新获取robots.txt
  • 重定向的想法不错,但我认为搜索引擎不会解析此重定向。为什么不简单地添加一个拒绝所有访问的 .htaccess 文件?
  • 好的,我做到了...,我使用的是 lighttpd,所以它是这样的:$HTTP["useragent"] =~ "Baiduspider" {url.access-deny = ("" )}

标签: robots.txt web-crawler


【解决方案1】:

停止处理来自百度蜘蛛的请求

将 lighttpd 附加到 lighttpd.conf

$HTTP["useragent"] =~ "Baiduspider" {url.access-deny = ( "" )}

百度蜘蛛迟早会重新获取 robots.txt (见http://blog.bauani.org/2008/10/baiduspider-spider-english-faq.html

【讨论】:

    猜你喜欢
    • 2014-12-11
    • 1970-01-01
    • 2012-07-03
    • 1970-01-01
    • 1970-01-01
    • 2014-05-22
    • 2013-11-22
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多