【发布时间】:2023-04-10 15:19:01
【问题描述】:
我尝试使用以下代码爬取存储在桌面中的本地 HTML 文件,但在爬取过程之前遇到以下错误,例如“没有这样的文件或目录:'/robots.txt'”。
- 是否可以在本地计算机(Mac)中抓取本地 HTML 文件?
- 如果可能,我应该怎么做 设置“allowed_domains”和“start_urls”等参数?
[Scrapy 命令]
$ scrapy crawl test -o test01.csv
[爬虫蜘蛛]
class TestSpider(scrapy.Spider):
name = 'test'
allowed_domains = []
start_urls = ['file:///Users/Name/Desktop/test/test.html']
[错误]
2018-11-16 01:57:52 [scrapy.core.engine] INFO: Spider opened
2018-11-16 01:57:52 [scrapy.extensions.logstats] INFO: Crawled 0 pages (at 0 pages/min), scraped 0 items (at 0 items/min)
2018-11-16 01:57:52 [scrapy.extensions.telnet] DEBUG: Telnet console listening on 127.0.0.1:6024
2018-11-16 01:57:52 [scrapy.downloadermiddlewares.retry] DEBUG: Retrying <GET file:///robots.txt> (failed 1 times): [Errno 2] No such file or directory: '/robots.txt'
2018-11-16 01:57:56 [scrapy.downloadermiddlewares.retry] DEBUG: Retrying <GET file:///robots.txt> (failed 2 times): [Errno 2] No such file or directory: '/robots.txt'
【问题讨论】:
-
嗨@Baka,我很高兴问题现已解决。仅供参考,我刚刚回滚了您对问题的最后一次编辑。原因:修复您的问题并使其成为“正确”版本会使未来的读者感到困惑,尤其是那些有类似问题并寻求帮助的人。
-
@starrify,我同意你的意见,你是对的。感谢您让我的问题变得有价值:-)