【问题标题】:How to use Scrapy如何使用 Scrapy
【发布时间】:2010-09-22 19:46:14
【问题描述】:

我想知道如何启动基于 Scrapy 的爬虫。我通过 apt-get install 安装了该工具,并尝试运行一个示例:

/usr/share/doc/scrapy/examples/googledir/googledir$ scrapy 列表 目录.google.com /usr/share/doc/scrapy/examples/googledir/googledir$ scrapy 抓取

我从 spiders/google_directory.py 破解了代码,但它似乎没有被执行,因为我没有看到我插入的任何打印。我阅读了他们的文档,但没有发现与此相关的内容;你有什么想法吗?

另外,如果您认为我应该使用其他工具来抓取网站,请告诉我。我没有使用 Python 工具的经验,Python 是必须的。

谢谢!

【问题讨论】:

    标签: python web-crawler scrapy


    【解决方案1】:

    您错过了 crawl 命令中的蜘蛛名称。使用:

    $ scrapy crawl directory.google.com
    

    另外,我建议您将示例项目复制到您的家中,而不是在/usr/share/doc/scrapy/examples/ 目录中工作,这样您就可以修改它并使用它:

    $ cp -r /usr/share/doc/scrapy/examples/googledir ~
    $ cd ~/googledir
    $ scrapy crawl directory.google.com
    

    【讨论】:

      【解决方案2】:

      EveryBlock.com 发布了一些使用 lxml、urllib2 和 Django 作为堆栈的quality scraping code

      Scraperwiki.com 励志,充满了python爬虫的例子。

      使用 cssselect 的简单示例:

      from lxml.html import fromstring
      
      dom = fromstring('<html... ...')
      navigation_links = [a.get('href') for a in htm.cssselect('#navigation a')]
      

      【讨论】:

      • 感谢您的回答;我稍后会看看这些技术。
      猜你喜欢
      • 2014-11-04
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多