【问题标题】:How do I use a wildcard to block bots from indexing this?我如何使用通配符来阻止机器人索引这个?
【发布时间】:2011-12-15 23:03:19
【问题描述】:

我的网址格式如下:

example.com/page/m6aoeh/embed

我想阻止任何机器人使用 url /page/*/embed 索引任何页面

我假设有一些方法可以阻止通配符 URL,但只是不确定在这种特殊情况下如何做到这一点。

【问题讨论】:

  • 在您的示例 URL 中,您有 page(单数),在您的路径过滤器中,您有 pages(复数)。我假设其中一个是错字。哪一个是正确的?
  • 这是一个错字。我已经更新了帖子。

标签: search-engine robots.txt googlebot


【解决方案1】:

如果您只是想向机器人指示 /page/ 文件夹下的所有内容不应被机器人索引,请使用 robots.txt exclusion standard。创建一个如下所示的/robots.txt

User-agent: *
Disallow: /page/

如果您希望机器人将 /page 文件夹下的某些页面而不是其他页面编入索引,则需要在 <head> 中为要排除的每个页面添加一个 <meta> tag

<meta name="robots" content="noindex, nofollow" />

【讨论】:

  • 所以你是说没有办法在 robots.txt 文件中做通配符?
  • robots.txt exclusion standard 不支持通配符。有些机器人可能尊重非标准扩展,但一般情况下你不能算。
猜你喜欢
  • 1970-01-01
  • 2017-12-05
  • 1970-01-01
  • 1970-01-01
  • 2021-04-14
  • 1970-01-01
  • 1970-01-01
  • 2012-08-13
  • 2011-03-23
相关资源
最近更新 更多