【问题标题】:Python web crawler with MySQL database带有 MySQL 数据库的 Python 网络爬虫
【发布时间】:2011-10-24 10:30:09
【问题描述】:

我想创建或查找一个用 Python 编写的开源网络爬虫(蜘蛛/机器人)。它必须找到并跟踪链接,收集元标记和元描述,网页的标题和网页的 url,并将所有数据放入 MySQL 数据库。

有人知道任何可以帮助我的开源脚本吗?另外,如果有人可以给我一些关于我应该做什么的指示,那么他们非常欢迎。

【问题讨论】:

    标签: python mysql sql web-crawler web-scraping


    【解决方案1】:

    是的,我知道,

    https://github.com/djay/transmogrify.webcrawler

    http://code.google.com/p/harvestman-crawler/

    http://code.activestate.com/pypm/orchid/

    开源网络爬虫

    http://scrapy.org/

    教程

    http://www.example-code.com/python/pythonspider.asp

    PS 我不知道他们是否使用 mysql,因为通常 python 使用 sqlit 或 postgre sql,所以如果你愿意,你可以使用我给你的库并导入 python-mysql 模块并执行它:D

    http://sourceforge.net/projects/mysql-python/

    【讨论】:

      【解决方案2】:

      我建议你使用Scrapy,这是一个基于Twistedlxml 的强大抓取框架。它特别适合您要执行的任务类型,它具有基于正则表达式的规则来跟踪链接,并允许您使用正则表达式或 XPath 表达式从 html 中提取数据。它还提供了他们所谓的“管道”来将数据转储到您想要的任何位置。

      Scrapy 不提供内置的 MySQL 管道,但有人写了一个 here,您可以以此为基础。

      【讨论】:

        【解决方案3】:

        Scrappy 是一个网络爬取和抓取框架,您可以扩展它以将选定的数据插入数据库。

        这就像 Django 框架的逆向。

        【讨论】:

          猜你喜欢
          • 2015-02-11
          • 2023-01-26
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 2015-05-12
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多