【发布时间】:2022-01-20 17:10:29
【问题描述】:
我对 scrapy 和 python 非常陌生。所以本周我试图从网页上抓取一个 XHR 请求,问题是我不知道为什么我每次都得到空导出, 这是文章:(谢谢你的好文章顺便说一句) https://www.zenrows.com/blog/web-scraping-intercepting-xhr-requests#use-case-auctioncom
导入scrapy 从 playwright.sync_api 导入 sync_playwright
类 GavSpider(scrapy.Spider): 名称 = 'gav'
url = "https://www.g2g.com/categories/wow-classic-tbc-gold-for-sale?region_id=ac3f85c1-7562-437e-b125-e89576b9a38e"
使用 sync_playwright() 作为 p: def 句柄响应(响应): # 我们感兴趣的端点 if ("/search?" in response.url): items = response.json()["payload"]["results"] [print(item["title"], item["display_price"]) for item in items]
browser = p.chromium.launch()
page = browser.new_page()
page.on("response", handle_response)
page.goto(url, wait_until="networkidle")
page.context.close()
browser.close()
顺便说一句,我可以完美地抓取它,它只是为了导出结果。 如果你能给我一些基本的提示、线索或任何可以让我在 xhr 抓取和导出数据方面做得更好的东西,我将不胜感激。
【问题讨论】: