【发布时间】:2019-07-08 07:22:02
【问题描述】:
This 是我正在抓取的网站的站点地图。第 3 个和第 4 个 <sitemap> 节点具有指向项目详细信息的 url。有没有办法只将爬取逻辑应用于那些
节点? (比如通过索引选择它们)
class MySpider(SitemapSpider):
name = 'myspider'
sitemap_urls = [
'https://www.dfimoveis.com.br/sitemap_index.xml',
]
sitemap_rules = [
('/somehow targeting the 3rd and 4th node', 'parse_item')
]
def parse_item(self, response):
# scraping the item
【问题讨论】:
-
节点有项目详细信息 - 没有此类详细信息 - 它们在
loc项目中包含 detalhes。你想按那个词过滤吗? -
@RomanPerekhrest 我的意思是他们有指向项目详细信息的 url。抱歉不清楚,我正在编辑我的帖子。我正在尝试从这些节点内的 url 中抓取项目详细信息。
-
澄清什么是item details?
-
@RomanPerekhrest 第三和第四节点内的每个 url 都是一个项目。如果我只能选择那些节点,我将向 url 发送请求并抓取项目详细信息。
标签: python xml scrapy web-crawler sitemap