【发布时间】:2014-05-28 17:05:16
【问题描述】:
我正在开始一个新的网站爬网项目,以使用网络服务在内部检索和存储数据。我查了一些资料,发现了 Scrapy 和 Beevolve 网络爬虫服务。
我的问题是,最好是自己创建没有经验的爬虫还是租用网络爬虫服务?
我遇到的一个问题是,有些网站需要先登录才能获取任何数据。
【问题讨论】:
-
“许多好的问题会根据专家的经验产生一定程度的意见,但这个问题的答案往往几乎完全基于意见,而不是事实、参考资料或特定专业知识。”跨度>
-
假设我没有python经验。虽然它带有文档。
-
我的 Python 经验也为零,但按照教程构建基本爬虫没有问题。当我不理解一些 Python 语法时,我只是查了一下资料。幸运的是,Python 是一种非常容易上手的语言,而且很有趣。
-
当您说基本爬虫时,您是指在 Scrapy 中?我很确定这不会是火箭科学,但想得到一个想法。谢谢。
-
正确,在 Scrapy 中。我还根据我的经验写了blog post。也许它会帮助你!
标签: web-crawler