【问题标题】:Why does Google not index my "robots.txt"?为什么 Google 不索引我的“robots.txt”?
【发布时间】:2019-03-11 05:22:45
【问题描述】:

我正在尝试让 Googlebot 网络爬虫为我的网站编制索引。我的robots.txt 最初看起来像这样:

User-agent: * 
Disallow: / 
Host: www.sitename.com 
Sitemap: https://www.sitename.com/sitemap.xml

我把它改成了:

User-agent: * 
Allow: / 
Host: www.sitename.com 
Sitemap: https://www.sitename.com/sitemap.xml 

只有 Google 仍未将我的链接编入索引。

【问题讨论】:

    标签: robots.txt googlebot sitemap.xml


    【解决方案1】:

    我正在尝试让 Googlebot 网络爬虫为我的网站编制索引。

    1. 机器人规则与索引无关!它们仅与爬行能力有关。一个页面即使被禁止爬也可以被索引!

    2. host 指令由 Yandex 支持。

    3. 如果您希望所有机器人都能抓取您的网站,您的 robots.txt 文件应放在https://www.sitename.com/robots.txt 下,状态码为 200,并包含:

      User-agent: * Disallow: Sitemap: https://www.sitename.com/sitemap.xml

    【讨论】:

      【解决方案2】:

      来自docs

      Robots.txt 语法可以被认为是 robots.txt 文件的“语言”。您可能会在 robots 文件中遇到五个常用术语。它们包括:

      用户代理:您要向其提供抓取指令的特定网络爬虫(通常是搜索引擎)。可以在此处找到大多数用户代理的列表。

      Disallow:用于告诉用户代理不要抓取特定 URL 的命令。每个 URL 只允许有一个“Disallow:”行。

      允许(仅适用于 Googlebot):告诉 Googlebot 它可以访问页面或子文件夹的命令,即使其父页面或子文件夹可能被禁止。

      抓取延迟:抓取工具在加载和抓取页面内容之前应该等待多少秒。请注意,Googlebot 不承认此命令,但可以在 Google Search Console 中设置抓取速度。

      站点地图:用于标出与此 URL 关联的任何 XML 站点地图的位置。请注意,此命令仅受 Google、Ask、Bing 和 Yahoo 支持。

      尝试在您的 robots.txt 指令中特别提及 Googlebot,例如:

      User-agent: Googlebot 
      Allow: /
      

      允许所有网络爬虫访问所有内容

      User-agent: * 
      Disallow: 
      

      【讨论】:

      • 我将 robots.txt 更改为用户代理:* 允许:/ 主机:www.sitename.com 站点地图:sitename.com/sitemap
      猜你喜欢
      • 2012-01-16
      • 2011-06-13
      • 1970-01-01
      • 2015-10-18
      • 2014-03-18
      • 1970-01-01
      • 1970-01-01
      • 2015-01-02
      • 1970-01-01
      相关资源
      最近更新 更多