【发布时间】:2019-03-01 04:26:43
【问题描述】:
试图减少提取我们数据的网站数量。这是 Stackoverflow 链接上的详细示例:
Scrapy not following pagination properly, catches the first link in the pagination
我对此比较陌生,但根据上一个链接中的信息,有没有办法阻止这个特定的爬虫?
【问题讨论】:
-
我认为通常它已经完成,但在您的网页 (robotstxt.org) 中有一个 robots.txt 文件。它会限制从您的网页大规模获取数据,但如果爬虫设置了一些时间延迟,他们仍然可以绕过它并从您的网络抓取数据(但速度要慢得多)。
-
@YilunZhang robots.txt 只是一个文本文件,它不会阻止任何人抓取该网站。一些机器人(搜索引擎)选择尊重 robots.txt 中的请求,仅此而已。