【问题标题】:GoogleBot overloads the server by spidering very frequentlyGoogleBot 通过非常频繁地爬取使服务器超载
【发布时间】:2015-07-10 00:02:56
【问题描述】:

我的网站有大约 500.000 个页面。我制作了 sitemap.xml 并列出了其中的所有页面(我知道每个文件有 50.000 个链接的限制,所以我有 10 个站点地图)。无论如何,我在 webmastertool 中提交了站点地图,一切似乎都很好(没有错误,我可以看到提交和索引链接)。 Hoverer 我经常遇到爬虫的问题。 GoogleBot 每天 4 次抓取同一页面,但在 sitemap.xml 中我告诉该页面每年都会更改。

这是一个例子

<url>
    <loc>http://www.domain.com/destitution</loc>
    <lastmod>2015-01-01T16:59:23+02:00</lastmod>
    <changefreq>yearly</changefreq>
    <priority>0.1</priority>
</url>

1) 那么如何告诉 GoogleBot 不要频繁爬取,因为它会使我的服务器过载?

2) 该网站有几个页面,例如http://www.domain.com/destitution1http://www.domain.com/destitution2 ... 我将规范网址放在http://www.domain.com/destitution。可能是多爬虫的原因吗?

【问题讨论】:

    标签: seo googlebot sitemap.xml


    【解决方案1】:

    您可以将此情况报告给 Google 抓取团队,请参见此处:

    一般来说,像这样的特定 Googlebot 抓取问题是最好的 直接通过网站管理员工具处理。我会通过网站 设置你的主域,Crawl Rate,然后使用“Report a Googlebot 出现问题”表单。通过此表单提交的内容 联系我们的 Googlebot 团队,他们可以确定需要什么(或者如果有的话) 在我们这边改变。他们通常无法回复,并且 将无法处理除了抓取问题以外的任何事情,但他们 肯定知道 Googlebot 并且可以帮助调整它的功能。

    https://www.seroundtable.com/google-crawl-report-problem-19894.html

    【讨论】:

      【解决方案2】:

      爬行会逐渐减慢。漫游器可能会重新访问您的网页,因为您的网页之间存在内部链接。

      一般来说,规范往往会降低抓取速度。但一开始,谷歌机器人需要同时抓取源页面和目标页面。稍后您会看到好处。

      Google 漫游器不一定会考虑 lastmodchangefreq 信息。但是,如果他们确定内容不被修改,他们就会减少回来的频率。这是时间问题。每个 URL 都有一个重新访问的调度程序。

      机器人适应服务器的容量(请参阅crawling summary 我维护的更多详细信息)。如果这是一个问题,您可以通过返回 http 错误代码 500 来暂时减慢机器人。他们会停下来,稍后再回来。

      我认为您的网站没有抓取问题。你看到的是正常行为。当同时提交多个站点地图时,可以暂时提高爬取率。

      【讨论】:

      • 感谢您的回答。我会继续检查服务器,我会报告结果。提交后,您的抓取已增加。
      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2012-03-26
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-05-30
      • 1970-01-01
      相关资源
      最近更新 更多