【发布时间】:2019-04-15 22:58:37
【问题描述】:
我正在尝试使用scrapy https://www.superbancos.gob.pa/es/fin-y-est/reportes-estadisticos?field_ano_rep_est_value=2018从该站点抓取数据
但我得到的响应是以下 html 响应:
您正在被重定向... 需要 Javascript。请先启用 javascript,然后才能看到此页面。
我尝试从 Chrome 浏览器中禁用 JavaScript 以查看是否可以获得相同的 Scrapy 响应,但它一直向我显示数据。
我不知道是否需要在我的 settings.py 中更改或添加一些东西
可能是请求标头吗?还是代理?
class TestSpider(scrapy.Spider):
name = "test"
def start_requests(self):
url = 'https://www.superbancos.gob.pa/es/fin-y-est/reportes-estadisticos?field_ano_rep_est_value=2018'
yield scrapy.Request(url=url, callback=self.parse)
def parse(self, response):
page = response.url.split("/")[-2]
filename = 'report-%s.html' % page
with open(filename, 'wb') as f:
f.write(response.body)
【问题讨论】:
-
Scrapy 有一个无头浏览器插件,可用于需要 JS 的网站
标签: python-3.x web-scraping scrapy