【问题标题】:How To Prevent Website From Being Scraped With Scrapy [duplicate]如何防止网站被 Scrapy 刮掉 [重复]
【发布时间】:2019-03-01 04:26:43
【问题描述】:

试图减少提取我们数据的网站数量。这是 Stackoverflow 链接上的详细示例:

Scrapy not following pagination properly, catches the first link in the pagination

我对此比较陌生,但根据上一个链接中的信息,有没有办法阻止这个特定的爬虫?

【问题讨论】:

  • 我认为通常它已经完成,但在您的网页 (robotstxt.org) 中有一个 robots.txt 文件。它会限制从您的网页大规模获取数据,但如果爬虫设置了一些时间延迟,他们仍然可以绕过它并从您的网络抓取数据(但速度要慢得多)。
  • @YilunZhang robots.txt 只是一个文本文件,它不会阻止任何人抓取该网站。一些机器人(搜索引擎)选择尊重 robots.txt 中的请求,仅此而已。

标签: scrapy screen-scraping


【解决方案1】:

我认为防止您的网站被抓取的唯一有效方法是软禁 IP 并限制它们在给定时间范围内允许发出的请求数量。 robots.txt 对 Google 等抓取工具很有用,但大多数抓取工具甚至不会检查这一点,而且绝不可能禁止将您的网站编入索引。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2019-04-21
    • 2013-01-17
    • 1970-01-01
    • 1970-01-01
    • 2012-03-05
    • 2011-10-28
    • 1970-01-01
    相关资源
    最近更新 更多