【发布时间】:2018-05-13 14:36:16
【问题描述】:
我想使用 Scrapy 抓取以下 HTML 代码:
<td class="xyz">
<div>Irrelevant</div>
I want to get this text!
</td>
如何提取该文本?
response.css('td.xyz::text').extract()
返回''
【问题讨论】:
标签: html css scrapy web-crawler
我想使用 Scrapy 抓取以下 HTML 代码:
<td class="xyz">
<div>Irrelevant</div>
I want to get this text!
</td>
如何提取该文本?
response.css('td.xyz::text').extract()
返回''
【问题讨论】:
标签: html css scrapy web-crawler
即使额外的div 存在与否,您也可以这样做来获取您想要的文本
response.css('td.xyz::text').extract()[-1]
【讨论】:
response.xpath('//td[@class="xyz"]/text()[2]').extract_first()
【讨论】:
<td> 元素,然后从中删除所有不相关的元素(使用 lxml 和 .remove() )
response.xpath('//td[@class="xyz"]/text()').extract()将为您工作