【发布时间】:2018-02-16 04:58:43
【问题描述】:
在创建了几个不同的蜘蛛之后,我认为我几乎可以刮任何东西,但我遇到了障碍。
给定以下代码sn-p:
<div class="col-md-4">
<div class="tab-title">Homepage</div>
<p>
<a target="_blank" rel="nofollow"
href="http://www.bitcoin.org">http://www.bitcoin.org
</a>
</p>
</div>
您将如何根据tab-title div 中的文本选择<a ... </a> 中的链接?
我需要这个条件的原因是因为有几个其他链接符合这个条件:
response.css('div.col-md-4 a::attr(href)').extract()
我的最佳猜测如下:
response.css('div.col-md-4 div.tab-title:contains("Homepage") a::attr(href)').extract()
感谢任何见解!先感谢您。
注意:我正在使用 Scrapy。
【问题讨论】:
标签: css-selectors scrapy scrapy-spider