【发布时间】:2018-04-05 18:33:19
【问题描述】:
我试图创建一个爬取第三方软件网站的蜘蛛,以创建当前版本号的存储库。这是我尝试从网站 css 获取当前 Firefox 版本号的脚本。我正在使用 Python 2.7
import scrapy
import html2text
from scrapy.selector import HtmlXPathSelector
class MozillaSpider(scrapy.Spider):
name = 'mozilla'
allowed_domains = ['mozilla.com']
start_urls = ['https://www.mozilla.org/en-US/firefox/notes/']
def parse(self, response):
hxs = HtmlXPathSelector(response)
version = hxs.select('//html[@id="data-latest-firefox"]/text()').extract()[0]
converter = html2text.HTML2Text()
converter.ignore_links = True
print(converter.handle(version))
【问题讨论】:
-
你的问题是什么?
-
这没有返回任何内容,我相信“版本”行是错误的,但我不知道如何
标签: python scrapy web-crawler version