【发布时间】:2020-04-24 18:38:13
【问题描述】:
我写了一个爬虫爬虫来从一个有几个子页面的网页上抓取数据。他们每个人还有几个子页面等。我想访问所有子子页面并从中获取特定信息。
为了越来越深入,我想用 xpath() 查询后续子页面以获取链接并输入它们。但是要使用 xpath,我需要一个 scrapy.http.response.html.HtmlResponse 类的对象。所以我写:
from scrapy.http import HtmlResponse
new_response = HtmlResponse(url=subpage_url)
但是当我对这样一个对象进行 xpath 查询时,我没有得到我应该得到的,只是一个空列表。我怀疑我没有在HtmlResponse() 中指定“body”参数。但是正文隐藏在来自subpage_url 的 HTML 中,我想从子页面中获取它。我是在做一些不正确的事情,还是有更好的方法从具有已知 URL 的子页面获取 HTML 以 xpath 查询此 HTML?
【问题讨论】:
-
您似乎在使用 Scrapy,就好像它是 Requests 库或类似库一样。我建议你先完成 Scrapy 教程。
-
对,也许我应该尝试使用 Scrapy 的不同方法或切换到 requests/beautiful soup。谢谢
标签: python web-scraping scrapy