【问题标题】:How to scrape this database site?如何抓取这个数据库站点?
【发布时间】:2022-12-03 05:27:48
【问题描述】:

我想对这个站点进行 scape,但信息似乎不是 html 代码。如何抓取此站点/信息?

https://golden.com/query/list-of-incubator-companies-NMB3

我曾尝试使用普通的 html 抓取,但我目前对抓取还不是很熟悉。

【问题讨论】:

    标签: web-scraping scrapy screen-scraping scrape


    【解决方案1】:

    该站点使用 javascript 来呈现其内容,但是您可以使用它的 api 以 json 格式抓取所有数据。

    api端点是:

    url = f"https://golden.com/api/v1/queries/list-of-incubators-and-accelerators-NMB3/results/?page={page_number}&per_page=25&order=&search="
    

    一个简单的 scrapy 示例可能看起来像这样。

    import scrapy
    
    class MySpider(scrapy.Spider):
        name = 'golden'
    
        def start_requests(self):
            for page_num in range(1,4):
                url = f"https://golden.com/api/v1/queries/list-of-incubators-and-accelerators-NMB3/results/?page={page_num}&per_page=25&order=&search="
                yield scrapy.Request(url)
    
        def parse(self, response):
            data = response.json()
            yield {"data": data["results"]}
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-08-27
      • 1970-01-01
      • 1970-01-01
      • 2014-07-21
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-09-08
      相关资源
      最近更新 更多