【问题标题】:Data Harvesting Urllib2+bs4 vs Scrapy数据收集 Urllib2+bs4 vs Scrapy
【发布时间】:2013-09-21 04:16:19
【问题描述】:

数据收集是我日常工作的一部分,通常我收集数据的方式是使用 urllib2 收集 html 页面,然后使用 beautifulsoup 解析出我想要的数据。

我经常听说 Python Scrapy 包。我看了一下 Scrapy,他们网站上的内容基本上是在谈论一般 Scraping 而不是“Scrapy”本身的重要性。

我想知道对于一个对 urllib2 和 beautifulsoup 有一定了解的人来说,Scrapy 是酷还是简单到足以让我放弃 urllib2 和 bs4 去选择?如果是这样,切换的主要原因是什么?

可能来自以下几个方面:

  1. 快速实现机器人

  2. 机器人的鲁棒性

  3. 易于维护您的机器人。

【问题讨论】:

    标签: python web-scraping beautifulsoup scrapy screen-scraping


    【解决方案1】:

    这是我的见解。

    Scrapy 旨在使网络抓取代码更简单、更有条理。它也非常快(它基于twisted)。

    那些蜘蛛类、项目、项目管道确实可以帮助您组织获取页面、跟踪链接、解析响应、收集数据、将其存储在某处等的过程。它为您提供了一个关于如何创建网络的想法和模板- 抓取项目。

    它不仅仅是urllib2 + bs4,它是一个框架:

    Scrapy 是一个用于抓取网站和 提取可用于广泛领域的结构化数据 有用的应用程序,如数据挖掘、信息处理或 历史档案。

    还有比我提到的更多的功能,请参阅这个内容丰富的 overview 文档页面,尤其是阅读 What else? 部分。

    选择(urllib2 + bs4Scrapy)实际上取决于任务、网络抓取代码的复杂性、是否需要将抓取的数据存储在某个地方等等。

    希望对您有所帮助。

    【讨论】:

    • 您必须始终相信亚历山大的回答。他在智力上可靠且诚实:)
    • @Begueradj 谢谢你的客气话。老实说,我不可靠:)
    • 好吧,如果没有你的几个宝贵的令人信服的答案,我将无法在去年 9 月获得我的文凭 :) 非常感谢你。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2015-07-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-11-20
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多