【发布时间】:2015-09-27 18:56:45
【问题描述】:
如何发现我的网站被抓取?
我有几点...
- 网络带宽占用,导致吞吐量问题(如果使用代理则匹配)。
- 在向搜索引擎查询关键字时,新的引用出现在具有相同内容的其他类似资源中(如果使用代理则匹配)。
- 来自同一 IP 的多个请求。
- 来自单个 IP 的高请求率。 (顺便问一下:什么是正常费率?)
- 无头或奇怪的用户代理(如果使用代理则匹配)。
- 从同一 IP 以可预测(相等)的间隔请求。
- 从不请求某些支持文件,例如。 favicon.ico,各种 CSS 和 javascript 文件(如果使用代理则匹配)。
- 客户端的请求序列。前任。客户端访问不可直接访问的页面(如果使用代理则匹配)。
您会在此列表中添加更多内容吗?
如果刮板使用代理,哪些点可能适合/匹配?
【问题讨论】:
-
相关:Can page scraping be detected? 和 The way to detect web scraping。基本上很难确定,因为他们使用不同的方法来混淆。
-
根据个人经验 - 单个 IP 访问您网站的速度将非常广泛地基于您的网站。例如,我曾经创建了一个网站,平均每天访问一次并且只查看几页(因为我们每天只发布一次信息)。其他网站(比如论坛,或动态更新的网站,其中经常发布大量信息),您可能会期待更多随机访问。或者,如果您的网站是一致的,它会非常罕见 - 可能每天 1-2 次,然后下降。
-
您能解释一下为什么要检测刮板吗?大多数网站都赞成它 - 抓取正是您进入搜索引擎的方式。如果您打算阻止它,您是否尝试过机器人排除协议?
-
我会将国家添加到该列表中。如果你突然看到来自中国的流量激增,即使它来自 1000 个不同的 IP 地址,那么你就会被刮掉。在这种情况下,IP 阻止和蜜罐可能会有所帮助。
-
@halfer,我问它是因为我想写一篇关于这个主题的文章。我的目的是在该主题上获得更多分数。许多网站所有者担心数据隐私、所有权和类似的事情。您能解释一下“机器人排除协议”吗?
标签: web web-scraping screen-scraping