【发布时间】:2011-10-24 10:30:09
【问题描述】:
我想创建或查找一个用 Python 编写的开源网络爬虫(蜘蛛/机器人)。它必须找到并跟踪链接,收集元标记和元描述,网页的标题和网页的 url,并将所有数据放入 MySQL 数据库。
有人知道任何可以帮助我的开源脚本吗?另外,如果有人可以给我一些关于我应该做什么的指示,那么他们非常欢迎。
【问题讨论】:
标签: python mysql sql web-crawler web-scraping
我想创建或查找一个用 Python 编写的开源网络爬虫(蜘蛛/机器人)。它必须找到并跟踪链接,收集元标记和元描述,网页的标题和网页的 url,并将所有数据放入 MySQL 数据库。
有人知道任何可以帮助我的开源脚本吗?另外,如果有人可以给我一些关于我应该做什么的指示,那么他们非常欢迎。
【问题讨论】:
标签: python mysql sql web-crawler web-scraping
是的,我知道,
库
https://github.com/djay/transmogrify.webcrawler
http://code.google.com/p/harvestman-crawler/
http://code.activestate.com/pypm/orchid/
开源网络爬虫
教程
http://www.example-code.com/python/pythonspider.asp
PS 我不知道他们是否使用 mysql,因为通常 python 使用 sqlit 或 postgre sql,所以如果你愿意,你可以使用我给你的库并导入 python-mysql 模块并执行它:D
【讨论】:
Scrappy 是一个网络爬取和抓取框架,您可以扩展它以将选定的数据插入数据库。
这就像 Django 框架的逆向。
【讨论】: