【发布时间】:2017-01-23 02:05:55
【问题描述】:
我有一个基于 javascript 的网站。具体来说,没有<a> 标签。当点击某些按钮时,内容会动态插入到 DOM 树中,然后使用 javascript 更改 URL 以表示更新。
所以,我的问题是,如果我的 robots.txt 中有链接列表,允许的网络爬虫(Google、Bing 等)会直接访问 robots.txt 中的链接,还是会遵循 @987654324 @链接显示在下载的网站中并在robots.txt中允许?
因为在第二种情况下,网络爬虫在下载的/ 站点和robots.txt 文件中都找不到任何URL。
【问题讨论】:
-
robots.txt只是告诉爬虫他们不允许爬入的内容,它不包含要访问的链接列表。 -
@Barmar:“一些主要的爬虫支持允许指令,它可以抵消随后的禁止指令。” (引自维基百科)。我只对这些大型网络爬虫感兴趣(Bing/Google,都在阅读
Allow指令)。 -
无论如何,这只是一个允许列表,而不是他们应该抓取的位置列表。他们通过以下链接获得去处。
-
无论如何,这个问题对于 SO 来说是题外话。 ServerFault.com 是询问网络服务器配置的地方。
标签: javascript url-rewriting web-crawler robots.txt