【发布时间】:2018-05-24 08:43:31
【问题描述】:
我是scrapy的新手。我想为我的个人实验制作我的网络爬虫,它将爬取整个互联网并将电子商务网站的 URL 存储到我的数据库中。我在谷歌上搜索过,找到了这个 this one 和更多的是几乎一样。
但是有start_urls = ['http://brickset.com/sets/year-2016']
我想修改并想添加整个 Internet。这可能吗?如果是,请指导我正确的方法。
提前致谢。
【问题讨论】:
-
不,这是不可能的
-
即使谷歌自己也不扫描整个互联网。这是不可能的。
-
所以,我每次都必须提供要抓取的 URL 吗?
标签: python scrapy web-crawler