【发布时间】:2019-03-22 18:24:15
【问题描述】:
第一次发帖。我感谢任何指导,并迫不及待地想回馈社区。
我正在尝试使用 scrapy 制作一个爬虫,以从该表中收集数据。
http://www.wikicfp.com/cfp/call?conference=machine%20learning
具体来说,会议名称、地点和日期。但是表、tr 和 td 没有类,并且表在另一个表中。
无论我如何编辑我的代码,它总是给我整个页面。
import scrapy
class CfpspiderSpider(scrapy.Spider):
name = 'cfpspider'
allowed_domains = ['http://www.wikicfp.com']
start_urls = ['http://www.wikicfp.com/cfp/call?conference=machine%20learning']
def parse(self, response):
div = response.css("div.contsec")
for table in div:
print(table.css("table")[3].css.extract_first())
稍后,我将努力使其移至下一页并输出 csv 或 json,但现在我试图获取此表的部分内容。我在scrapy shell中测试了一些命令,但是我的知识很缺乏。 谢谢
【问题讨论】:
标签: python html scrapy web-crawler