【发布时间】:2015-11-30 00:43:45
【问题描述】:
我想抓取/检查多个网站(在同一域上)以获取特定关键字。我找到了这个脚本,但我找不到如何添加要搜索的特定关键字。脚本需要做的是找到关键字,并给出找到它的链接的结果。谁能指出我可以在哪里阅读更多相关信息? 我一直在阅读scrapy's documentation,但我似乎找不到这个。
谢谢。
class FinalSpider(scrapy.Spider):
name = "final"
allowed_domains = ['example.com']
start_urls = [URL % starting_number]
def __init__(self):
self.page_number = starting_number
def start_requests(self):
# generate page IDs from 1000 down to 501
for i in range (self.page_number, number_of_pages, -1):
yield Request(url = URL % i, callback=self.parse)
def parse(self, response):
**parsing data from the webpage**
【问题讨论】:
标签: web web-crawler scrapy keyword extraction