【发布时间】:2014-06-27 18:13:15
【问题描述】:
我在下面构建了一个简单的网络爬虫:
from scrapy.spider import BaseSpider
from scrapy.selector import HtmlXPathSelector
class ITTester(BaseSpider):
name = 'ITTester'
allowed_domains = ["sec.gov"]
start_urls = ['http://www.sec.gov/Archives/edgar/data/320193/000112760212034445/xslF345X03/form4.xml']
def parse(self, response):
hxs = HtmlXPathSelector(response)
sites = hxs.select("/html/body/table[3]/tbody/tr")
print len(sites)
for site in sites:
HHH = site.select("/td[1]/span[1]/text()").extract()
print HHH
我转到this site,我想抓取并打印“Common Stock”的每个实例(即“Common Stock”的 2 倍)。
我已经用hxs.select("/html/body/table[3]/tbody/tr") 标识了表格的行,当打印返回的XPathSelectorList 的长度时,它会打印2,但是for loop 中的打印会返回2 个空白括号[]。我已经使用 Firebug 来获取 XPath,我检查了 tbody 确实在源代码中。
对我做错了什么有任何想法吗?
【问题讨论】:
标签: python xpath scrapy firebug