【发布时间】:2016-08-17 01:49:18
【问题描述】:
我正在尝试抓取一个网站,但 robots.txt 中只有以下行:
User-agent: *
这是否意味着它不在乎我是否抓取他们的网站?
【问题讨论】:
-
这意味着同一组中的以下行适用于所有用户代理。
标签: web web-crawler robots.txt
我正在尝试抓取一个网站,但 robots.txt 中只有以下行:
User-agent: *
这是否意味着它不在乎我是否抓取他们的网站?
【问题讨论】:
标签: web web-crawler robots.txt
是的,如果 User-agent: * 是 robots.txt 中的唯一行,则允许您抓取所有内容。
只有Disallow 行有权列出不得抓取的 URL 路径(开头)。如果 robots.txt 没有 Disallow 行,则不允许任何内容。
也就是说,那个 robots.txt 的作者可能犯了一个错误。 User-agent 行之后通常是 Disallow 行(或其他,如 Allow 等)。开始记录是没有意义的¹,但没有为匹配的用户代理说明任何内容。
¹ 一条记录以一个或多个User-agent 行开头,并以空行与其他记录分隔。 User-agent: * 匹配所有未被该 robots.txt 中任何其他 User-agent 行匹配的用户代理。
【讨论】: