【发布时间】:2013-07-28 10:29:01
【问题描述】:
全部,
我正在尝试完全自动化我的抓取,这由 3 个步骤组成:
1- 获取广告的索引页面列表(非scrapy工作,出于各种原因) 2- 从第一步获得的索引页面中获取广告URL列表(Scrapy工作)
我的scrapy项目在普通目录下:
C:\Python27\Scripts\GetAdUrlsFromIndex_project\GetAdUrlsFromIndex\spiders\GetAdUrls_spider.py (“GetAdUrls_spider”文件中的蜘蛛名称是(name = “getadurls”))
我的自动化步骤 1 和 2 的脚本位于此目录中:
C:\Website_DATA\SCRIPTS\StepByStepLauncher.py
我尝试使用 Scrapy 文档导入爬虫并使用以下代码从脚本内部运行:
from twisted.internet import reactor
from scrapy.crawler import Crawler
from scrapy.settings import Settings
from scrapy import log
from GetAdUrlsFromIndex.spiders.GetAdUrls_spider import getadurls
spider = getadurls(domain='website.com')
crawler = Crawler(Settings())
crawler.configure()
crawler.crawl(spider)
crawler.start()
log.start()
reactor.run() # the script will block here
不幸的是,当我尝试运行此脚本时,我不断收到错误“没有名为 GetAdUrlsFromIndex.spiders.GetAdUrls_spider 的模块”。我尝试将工作目录更改为几个不同的位置,我尝试了名称,但似乎没有任何效果。 .
不胜感激。谢谢!
【问题讨论】:
-
是
C:\Python27\Scripts\GetAdUrlsFromIndex_project` in yourPYTHONPATH`? -
嗨,Twil...我实际上根本没有 PYTHONPATH 变量!!。我创建了一个并添加了这个,但仍然无法正常工作......
-
文件夹
GetAdUrlsFromIndex和spiders是否包含__init__.py? -
是的,它们确实是 twil... 这两个文件夹都包含一个 init.py.. 但是它们都是空白的。我需要在其中包含任何内容吗?