【问题标题】:Scrapy / Python: getting the unknown [index] of TR itemScrapy / Python:获取TR项目的未知[索引]
【发布时间】:2018-04-26 05:25:52
【问题描述】:

我得到了这个选择器:

sel = response.xpath('//table//tr[td[@class="ad73"]]')

这将返回位于页面不同位置的 TR 选择器列表。

有什么方法可以知道每个 TR 的绝对索引号(从 (//TABLE/TR) 开始,以便稍后在另一个函数中按顺序处理它们?

【问题讨论】:

  • 我为什么要这样做?因为紧跟在这些 TR 之后是其他 TR ,其中包含我需要抓取的数据,但它们没有任何类型的类或唯一属性来定位它们
  • 感谢您的回答,但这是针对 Selenium 的——我没有使用它(我还没有掌握 scrapy),AFAIK Selenium 是一个完全不同的框架...

标签: python html xpath scrapy scrapy-spider


【解决方案1】:

不太确定您在这里尝试做什么,但请关注您的评论:

紧跟在这些 TR 之后是其他带有我需要抓取的数据的 TR

我会说你需要 following-sibling 魔法,它可以做到它所说的:

sel = response.xpath('//table//tr[td[@class="ad73"]]/following-sibling::tr')

这将在您确定的tr 之后为您提供以下信息。

【讨论】:

    猜你喜欢
    • 2014-10-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-05
    • 2013-11-03
    • 2011-03-02
    • 1970-01-01
    相关资源
    最近更新 更多