【发布时间】:2017-11-09 03:33:36
【问题描述】:
我是 scrapy 的新手。我想从网上抓取一些数据。我得到了如下的 html 文档。
dom style1:
<div class="user-info">
<p class="user-name">
something in p tag
</p>
text data I want
</div>
dom style2:
<div class="user-info">
<div>
<p class="user-img">
something in p tag
</p>
something in div tag
</div>
<div>
<p class="user-name">
something in p tag
</p>
text data I want
</div>
</div>
我想获取我想要的文本数据,现在我可以使用css或xpath 选择器通过检查它是否存在来获取它。但我想知道一些更好的方法。
比如我可以先得到cssp.user-name,然后得到it's parent,然后得到div/text(),而我想要的数据总是@987654325的text() @的直系父母div,但问题是,我怎样才能得到直系父母p.user-name?
【问题讨论】:
标签: python xpath scrapy web-crawler parent-child