【发布时间】:2015-07-03 13:02:30
【问题描述】:
我刚开始爬。我正在尝试通过使用 Scrapy 框架和 Python 2.7 下载内容来从网站 http://www.indiabix.com/verbal-ability/spotting-errors/ 抓取问题和答案。我注意到,如果您查看其来源,您会注意到每个问题的答案都应该在 b 标签中,但不是:
<div class="div-spacer">
<p><span class="ib-green"><b>Answer:</b></span> Option <b class="jq-hdnakqb"></b></p>
<p><span class="ib-green"><b>Explanation:</b></span></p>
<p> No answer description available for this question. <b><a href="discussion-399">Let us discuss</a></b>. </p>
如果我们检查网页上的元素,我们可以在标签之间的文本中看到正确的答案:答案:每个问题的选项 A 或 B 等,但 HTML 源代码没有。
为了获得 b 标记中的文本,我使用 xpath 尝试了大约 15 个查询。 我在下面的代码中将最可能的 4-5 个查询编写为 cmets。
import scrapy
import urllib
import json
from errors1.items import Errors1Item
class Errors1Spider(scrapy.Spider) :
name = "errors1"
start_urls = ["http://www.indiabix.com/verbal-ability/spotting-errors/"]
def parse(self, response) :
i = 0
y = 0
j = json.loads(json.dumps(response.xpath('//td[contains(@id, "tdOption")]/text()').extract()))
x = json.loads(json.dumps(response.xpath('//div[@class="div-spacer"]/p[3]/text()').extract()))
#to get correct answer
#response.xpath('//div[@class = "div-spacer"]/p/b/text()').extract()
#response.xpath('//div[@class = "div-spacer"]/p[1]/b/text()').extract()
#response.xpath('//div[@class = "div-spacer"]/p//text()').extract()
#response.xpath('//b[@class = "jq-hdnakqb"]/text()').extract()
#response.xpath('string(//div[@class = "div-spacer"]/p/b/text())').extract()
while i<len(j) and y<len(x) :
item = Errors1Item()
item['optionA'] = j[i]
i+=1
item['optionB'] = j[i]
i+=1
item['optionC'] = j[i]
i+=1
item['optionD'] = j[i]
i+=1
item['explanation'] = x[y]
y+=1
yield item
有人可以帮我从该网页获取答案内容吗? 谢谢
【问题讨论】:
标签: python python-2.7 xpath web-scraping scrapy