【发布时间】:2019-03-20 13:35:27
【问题描述】:
我可以从下面的 span 中提取文本:
使用这个 xpath:
'./div/a/div/div/div/span/text()'
结果:
(12)
但奇怪的是,有时服务器会在两者之间放置评论标签,所以我无法获得预期的结果,
review = product.xpath('./div/a/div/div/div/span/text()').extract_first()
In [1]: review
Out[2]: '('
review = product.xpath('./div/a/div/div/div/span').extract_first()
In [3]: review
Out[4]: '<span class="_2wY6y7fV">(<!-- -->12<!-- -->)</span>'
尽管我没有在第一张图片中看到 chrome DevTools 上的评论标签,但很奇怪。
如何绕过评论标签(如果呈现)并获得结果?
【问题讨论】:
-
试试
"".join(product.xpath('./div/a/div/div/div/span/text()').extract())
标签: dom xpath web-scraping scrapy