【发布时间】:2015-10-18 05:04:33
【问题描述】:
我制作了一个可以从项目根目录中的脚本成功运行的 Scrapy 蜘蛛。由于我需要从同一个脚本的不同项目中运行多个蜘蛛(这将是一个 django 应用程序根据用户的请求调用该脚本),我将脚本从其中一个项目的根目录移动到了父目录。出于某种原因,该脚本不再能够获取项目的自定义设置,以便将抓取的结果通过管道传输到数据库表中。这是我用来从脚本运行蜘蛛的 scrapy 文档中的代码:
def spiderCrawl():
settings = get_project_settings()
settings.set('USER_AGENT','Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1)')
process = CrawlerProcess(settings)
process.crawl(MySpider3)
process.start()
是否需要导入一些额外的模块才能从项目外部获取项目设置?还是需要对此代码进行一些补充?下面我还有运行蜘蛛的脚本代码,谢谢。
from ticket_city_scraper.ticket_city_scraper import *
from ticket_city_scraper.ticket_city_scraper.spiders import tc_spider
from vividseats_scraper.vividseats_scraper import *
from vividseats_scraper.vividseats_scraper.spiders import vs_spider
tc_spider.spiderCrawl()
vs_spider.spiderCrawl()
【问题讨论】:
标签: python django web-scraping scrapy