【发布时间】:2022-12-03 05:27:48
【问题描述】:
我想对这个站点进行 scape,但信息似乎不是 html 代码。如何抓取此站点/信息?
https://golden.com/query/list-of-incubator-companies-NMB3
我曾尝试使用普通的 html 抓取,但我目前对抓取还不是很熟悉。
【问题讨论】:
标签: web-scraping scrapy screen-scraping scrape
我想对这个站点进行 scape,但信息似乎不是 html 代码。如何抓取此站点/信息?
https://golden.com/query/list-of-incubator-companies-NMB3
我曾尝试使用普通的 html 抓取,但我目前对抓取还不是很熟悉。
【问题讨论】:
标签: web-scraping scrapy screen-scraping scrape
该站点使用 javascript 来呈现其内容,但是您可以使用它的 api 以 json 格式抓取所有数据。
api端点是:
url = f"https://golden.com/api/v1/queries/list-of-incubators-and-accelerators-NMB3/results/?page={page_number}&per_page=25&order=&search="
一个简单的 scrapy 示例可能看起来像这样。
import scrapy
class MySpider(scrapy.Spider):
name = 'golden'
def start_requests(self):
for page_num in range(1,4):
url = f"https://golden.com/api/v1/queries/list-of-incubators-and-accelerators-NMB3/results/?page={page_num}&per_page=25&order=&search="
yield scrapy.Request(url)
def parse(self, response):
data = response.json()
yield {"data": data["results"]}
【讨论】: