【问题标题】:unable to scrape https://angel.co/无法抓取 https://angel.co/
【发布时间】:2019-08-26 22:45:22
【问题描述】:

我正在尝试使用抓取该网站的几页。

我已经尝试了有关此网站的各种堆栈溢出答案,但都没有奏效。网站上的所有页面只返回 403。我尝试过更改 ip 和更改用户代理

headers = {
            "accept": "text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,image/apng,*/*;q=0.8,application/signed-exchange;v=b3",
            "accept-language": "en-US,en;q=0.9,ru-RU;q=0.8,ru;q=0.7",
            "cache-control": "no-cache",
            "pragma": "no-cache",
            "upgrade-insecure-requests": "1"
        }

yield scrapy.Request('https://angel.co/login',callback=self.parse, method='GET',headers=headers)

我怎样才能让我的蜘蛛成功抓取这个网站?我已经检查过这个网站运行良好,即使 javascript 被禁用但仍然无法抓取:(

【问题讨论】:

标签: python curl scrapy python-requests scrapy-shell


【解决方案1】:

本网站正在使用 cloudflare ddos​​ 防护服务。

尝试在您的标头中使用一些标头,例如 user-agent: Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.77 Safari/537.36

你必须让服务器相信你是一个浏览器,而不是一个爬虫。

一些 cloudflare ddos​​ 防护需要运行 javascript。还有一些人需要机器无法回答的验证码

首先,将您的回复写入一个文件,然后查看该文件以了解这是什么样的保护。其次,由于问题尝试处理

【讨论】:

  • 你是对的。我没想过检查回复。天才 cloudfare 正在抛出验证码
  • 所以,你现在和我一样被 cloudflare 逮捕了 :))
  • 是的 :(。尝试 cfscrape 模块但仍然没有希望 :(
  • cfscrape 我认为适用于 js 保护。验证码保护没有逃生路径:)
  • 从头开始,cloudfare 只是在浏览器中向我扔了验证码:(
猜你喜欢
  • 1970-01-01
  • 2021-12-07
  • 1970-01-01
  • 1970-01-01
  • 2015-10-04
  • 2019-04-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多