【发布时间】:2013-01-15 22:30:21
【问题描述】:
我想抓取一个网站。它的 robots.txt 文件中有以下内容,但我不确定他们不希望我做什么:
User-agent: *
Disallow: /click
没有点击子目录。或者他们不希望我访问通常需要单击的任何内容(例如通过表单提交数据)?在任何情况下,他们肯定不会让事情变得容易 - 主页的表单获取到设置由第三页读取的 cookie 的站点。
【问题讨论】:
我想抓取一个网站。它的 robots.txt 文件中有以下内容,但我不确定他们不希望我做什么:
User-agent: *
Disallow: /click
没有点击子目录。或者他们不希望我访问通常需要单击的任何内容(例如通过表单提交数据)?在任何情况下,他们肯定不会让事情变得容易 - 主页的表单获取到设置由第三页读取的 cookie 的站点。
【问题讨论】:
这意味着没有机器人应该抓取任何路径以字符串click开头的URL。
例如,应阻止以下 URL:
example.com/clickexample.com/click.htmlexample.com/click/example.com/click/foo/barexample.com/clicker以下网址仍将被允许:
example.com/foo/clickexample.com/fooclickexample.com/clic您可以在 http://www.robotstxt.org/wc/robots.html 找到原始 robots.txt 规范。
【讨论】: