【问题标题】:How to make web crawler for all e-commerce websites如何为所有电子商务网站制作网络爬虫
【发布时间】:2018-05-24 08:43:31
【问题描述】:

我是scrapy的新手。我想为我的个人实验制作我的网络爬虫,它将爬取整个互联网并将电子商务网站的 URL 存储到我的数据库中。我在谷歌上搜索过,找到了这个 this one 和更多的是几乎一样。

但是有start_urls = ['http://brickset.com/sets/year-2016'] 我想修改并想添加整个 Internet。这可能吗?如果是,请指导我正确的方法。

提前致谢。

【问题讨论】:

  • 不,这是不可能的
  • 即使谷歌自己也不扫描整个互联网。这是不可能的。
  • 所以,我每次都必须提供要抓取的 URL 吗?

标签: python scrapy web-crawler


【解决方案1】:

所以让我们以不同的方式处理这个问题。构建一个能真正爬取所有电商网站并给你带来结果的爬虫,其实是不可能的。

这给我们留下了最好的选择Search Engines。您可以做的是使用您的product query 抓取任何搜索引擎,并收集列出待售产品的链接。

您将面临的第二个挑战是如何区分e-commerce 网站和other 网站。 DiffBot 之类的工具会对此有所帮助。

这需要实时完成,因为显然您不会计划在 Internet 上的索引站点上创建一个包含所有产品的庞大数据库。

【讨论】:

  • 这对我的紧急解决方案确实很有帮助,但我还有 1 个问题。如果这不可能,你能告诉谷歌的算法,他们是如何抓取页面的,我的意思是他们如何知道,新网站添加,并且必须抓取
  • 首先,我想这需要说一下,Google 不会抓取百分之一的网络。现在,Google 爬虫实际上会检测到他们已经爬取过的网页上的新链接,并放置死链接,即指向to-be-crawled 队列的新链接。更多信息here
  • 另外,如果我的回答有帮助,请接受它是正确的:)
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2023-03-21
  • 2015-07-15
  • 2018-07-19
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-04-11
相关资源
最近更新 更多