【问题标题】:Scrape the last anchor href of each parent element (Using Ruby Nokogiri)刮掉每个父元素的最后一个锚href(使用Ruby Nokogiri)
【发布时间】:2013-11-14 12:18:08
【问题描述】:

我正在尝试使用 Nokogiri 在 JamBase 上抓取事件信息的 href。这是网址:http://www.jambase.com/shows/Shows.aspx?ArtistID=0&VenueID=0&City=Philadelphia&State=pa&Zip=19102&radius=0&StartDate=11/1/2013&EndDate=11/1/2014&Rec=False&pagenum=1&pasi=600

事件信息的 href 位于 td.toolCol 下的最后一个锚点中。我可以使用以下方法获取所有href:

page = Nokogiri::HTML(open("http://www.jambase.com/shows/Shows.aspx?ArtistID=0&VenueID=0&City=Philadelphia&State=pa&Zip=19102&radius=0&StartDate=11/1/2013&EndDate=11/1/2014&Rec=False&pagenum=1&pasi=700"))

page.css("td.toolCol a").map{|x| x["href"]}.each{|f| puts f}

但我不知道如何获取最后一个 href。 (仅供参考,有时 href 是第三个元素或第四个元素。最好直接指向最后一个元素。)

谢谢。

【问题讨论】:

    标签: ruby regex web-scraping nokogiri css-selectors


    【解决方案1】:

    您可以使用 CSS :last-* 伪类之一,例如 :last-of-type

    page.css('td.toolCol a:last-of-type').map { |x| x['href'] }
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-04-10
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-04-28
      • 2015-07-28
      • 1970-01-01
      相关资源
      最近更新 更多