【问题标题】:Does web crawlers follow robots.txt urls or a tags [closed]网络爬虫是否遵循 robots.txt 网址或标签 [关闭]
【发布时间】:2017-01-23 02:05:55
【问题描述】:

我有一个基于 javascript 的网站。具体来说,没有<a> 标签。当点击某些按钮时,内容会动态插入到 DOM 树中,然后使用 javascript 更改 URL 以表示更新。

所以,我的问题是,如果我的 robots.txt 中有链接列表,允许的网络爬虫(Google、Bing 等)会直接访问 robots.txt 中的链接,还是会遵循 @987654324 @链接显示在下载的网站中并在robots.txt中允许?

因为在第二种情况下,网络爬虫在下载的/ 站点和robots.txt 文件中都找不到任何URL。

【问题讨论】:

  • robots.txt 只是告诉爬虫他们不允许爬入的内容,它不包含要访问的链接列表。
  • @Barmar:“一些主要的爬虫支持允许指令,它可以抵消随后的禁止指令。” (引自维基百科)。我只对这些大型网络爬虫感兴趣(Bing/Google,都在阅读Allow 指令)。
  • 无论如何,这只是一个允许列表,而不是他们应该抓取的位置列表。他们通过以下链接获得去处。
  • 无论如何,这个问题对于 SO 来说是题外话。 ServerFault.com 是询问网络服务器配置的地方。

标签: javascript url-rewriting web-crawler robots.txt


【解决方案1】:

您可以使用Sitemaps 为抓取工具提供网址列表。正如@Barmar 所说,robots.txt 的用途略有不同。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2011-07-07
    • 1970-01-01
    • 2012-01-13
    • 2023-04-01
    • 1970-01-01
    • 1970-01-01
    • 2012-02-09
    • 1970-01-01
    相关资源
    最近更新 更多