【发布时间】:2014-07-09 15:31:34
【问题描述】:
我目前正在使用 Scrapy 从网站中提取公司信息。但是,跨页面提供的数据量大不相同。比如说,一家公司列出了三名团队成员,而另一家只列出了两名,或者一家公司列出了其所在的位置,而另一家则没有。因此,某些 XPath 可能会返回 null,因此尝试访问它们会导致错误:
try:
item['industry'] = hxs.xpath('//*[@id="overview"]/div[2]/div[2]/p/text()[2]').extract()[0]
except IndexError:
item['industry'] = "None provided"
try:
item['URL'] = hxs.xpath('//*[@id="ContentPlaceHolder_lnkWebsite"]/text()').extract()[0]
except IndexError:
item['URL'] = "None provided"
try:
item['desc'] = hxs.xpath('//*[@id="overview"]/div[2]/div[4]/p/text()[1]').extract()[0]
except IndexError:
item['desc'] = "None provided"
try:
item['founded'] = hxs.xpath('//*[@id="ContentPlaceHolder_updSummary"]/div/div[2]/table/tbody/tr/td[1]/text()').extract()[0]
except IndexError:
item['founded'] = "None provided"
我的代码使用了许多 try/catch 语句。由于每个异常都特定于我要填充的字段,是否有更清洁的方法来解决这个问题?
【问题讨论】:
标签: python python-2.7 web-scraping try-catch scrapy