【问题标题】:IIS set up effecting bots which is impacting on search resultsIIS 设置影响搜索结果的机器人
【发布时间】:2015-03-27 00:26:45
【问题描述】:

这是一个很难解释的问题。我相信由于 iis/站点的设置方式,google bot 会感到困惑。实际问题是,当搜索 Google 时,结果是 www.someSiteURL.com,下面的描述是:

由于此站点的 robots.txt,无法获得此结果的说明 - 了解更多信息。

我认为问题存在的原因相当清楚。使用上面的示例,www.someSiteURL.com/default.asp 处没有页面内容。在此级别,有一个 default.asp 文件,其中包含大量重定向,可将用户带到站点所在的正确物理目录。这些站点都位于 IIS 中的一个根“站点”下,如下所示:

siteOneDir
siteTwoDir  
siteThreeDir
default.asp (this is the page with the redirects)

如何在不更改站点设置/使用 IPAddresses 的情况下克服这个问题?

这是 robots.txt 文件:

User-agent: *
Allow: /default.asp
Allow: /siteOneDir/
Allow: /siteTwoDir/
Allow: /siteThreeDir/
Disallow: / 

顺便说一句,谷歌网站管理员工具说这是有效的。我知道有些客户可能无法识别“允许”,但 Google 和 Bing 会这样做,所以我不在乎。我宁愿禁止所有站点,然后只允许站点,而不是仅使用它来禁止特定站点。

如果我使用 Google 网站管理员工具 Crawl > Fetch a Google 并输入 www.someSiteURL.com/default.asp,它的状态为“已重定向”,其状态为 http/1.1 302 found

【问题讨论】:

标签: asp-classic iis-7 seo robots.txt search-engine-bots


【解决方案1】:

我认为 robots.txt 中项目的顺序很重要。尝试将禁止放在首位,即。改为:

User-agent: *
Disallow: /
Allow: /default.asp
Allow: /siteOneDir/
Allow: /siteTwoDir/
Allow: /siteThreeDir/

【讨论】:

  • 这取决于什么客户。从阅读标准看来,最好的做法是允许然后禁止迎合只阅读一条指令的客户。这不是谷歌的情况,但显然是一种可能的情况。
  • 好吧,我可能弄错了。根据 Google 的说法,最具体的规则优先。
猜你喜欢
  • 2015-04-20
  • 2011-01-19
  • 2011-09-25
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2011-07-13
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多