【问题标题】:The * character in the Disallow statement of the Robots.txt FileRobots.txt 文件的 Disallow 语句中的 * 字符
【发布时间】:2012-08-27 13:44:36
【问题描述】:

不同的搜索机器人如何解释 robots.txt 文件的 disallow 语句中的 * 字符?他们都把它当作“无,一个或多个字符”吗?

我们来看下面的例子:

User-agent: *           
Disallow: /back-end*/*

上面的代码是什么意思? 这是否意味着任何具有“后端”的目录都不会被索引,即使“后端”这个词后面跟着任何字符集? / 之后的 * 怎么样?写它是一个好的约定吗?

一般来说,我的问题是关于 disallow 语句中 * 的使用以及是否所有搜索引擎爬虫都以相同的方式对待它。

【问题讨论】:

    标签: search-engine web-crawler robots.txt search-engine-bots


    【解决方案1】:

    机器人排除标准没有提及 Disallow: 语句中的 * 字符。一些爬虫(如 Googlebot 和 Slurp)识别包含 * 的字符串,而 MSNbot 和 Teoma 以不同的方式解释它。

    【讨论】:

    • 好的!谢谢。这些不同的方式是什么? * 字符的真正用途是什么?
    • 查看维基百科文章了解更多信息。 en.wikipedia.org/wiki/Robots_exclusion_standard
    • * 是为贪婪选择“允许”而设计的。搜索引擎(一般的索引)是为您的信息提供入口位置,以禁止在已知特定目的地时通常发生的事情。有关差异的一些信息在这里 ghita.org/search-engines-dynamic-content-issues.html
    • 这很有帮助。所以一般来说,据我了解,不建议使用 * 字符,因为它在 disallow 语句中没有标准化。或者你怎么看?还有别的,你怎么看 * after / 的使用?如:/back-end/*
    • @CompilingCyborg: 不需要,因为/back-end 已经阻止了所有具有 "/back-end" 开头的 URL 的页面,所以 "/back-end-foobar"并且“/back-end/foobar”和“/back-end.html”也被屏蔽了。
    猜你喜欢
    • 2022-07-06
    • 1970-01-01
    • 1970-01-01
    • 2017-06-13
    • 1970-01-01
    • 2011-06-13
    • 1970-01-01
    • 1970-01-01
    • 2013-10-16
    相关资源
    最近更新 更多