【问题标题】:using scrapy parsing a website under same div使用scrapy解析同一div下的网站
【发布时间】:2013-07-09 13:03:54
【问题描述】:

我需要使用scrapy解析一个网站。html页面模式如下

div class="nameinfo"
     div class="namesub"
           跨度 class="namesub">/span>
           span class="info">1 类数据 /span>
     /div
     div class="namesub">
          跨度 class="namesub">/span>
          span class="info">2 类数据 /span>
    /div>
div class="namesub"> 跨度 class="namesub">/span> span class="info">类型 3 的数据 /span>> /div> /div
我有上面标记的三种不同类型的数据。知道如何获得所需的数据。它们都在 div 内的 span 元素中,类属性为“namesub”。提前致谢:)

【问题讨论】:

    标签: python web-scraping scrapy


    【解决方案1】:

    这是你应该在你的蜘蛛里面放的东西:

    hxs = HtmlXPathSelector(response)
    
    namesubs = hxs.select("//div[@class='namesub']")
    for namesub in namesubs:
        item = MyItem()
        item["info"] = namesub.select('.//span[@class="info"]/text()').extract()[0]
    
        yield item
    

    此代码假定您已使用 info 字段定义了 MyItem 项目类。

    希望对您有所帮助。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-08-21
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多