【问题标题】:How to web crawl some sites [closed]如何网页抓取一些网站[关闭]
【发布时间】:2014-05-28 17:05:16
【问题描述】:

我正在开始一个新的网站爬网项目,以使用网络服务在内部检索和存储数据。我查了一些资料,发现了 Scrapy 和 Beevolve 网络爬虫服务。

我的问题是,最好是自己创建没有经验的爬虫还是租用网络爬虫服务?

我遇到的一个问题是,有些网站需要先登录才能获取任何数据。

【问题讨论】:

  • “许多好的问题会根据专家的经验产生一定程度的意见,但这个问题的答案往往几乎完全基于意见,而不是事实、参考资料或特定专业知识。”跨度>
  • 假设我没有python经验。虽然它带有文档。
  • 我的 Python 经验也为零,但按照教程构建基本爬虫没有问题。当我不理解一些 Python 语法时,我只是查了一下资料。幸运的是,Python 是一种非常容易上手的语言,而且很有趣。
  • 当您说基本爬虫时,您是指在 Scrapy 中?我很确定这不会是火箭科学,但想得到一个想法。谢谢。
  • 正确,在 Scrapy 中。我还根据我的经验写了blog post。也许它会帮助你!

标签: web-crawler


【解决方案1】:

如果您想用 Java 创建自己的网络爬虫,您可能需要查看this

你也可以看看jSpiderjsoup

编辑:这也可以工作:crawler4j

【讨论】:

  • 也许这是一个愚蠢的问题,但是 JSpider 是否也可以与其他网站一起使用?
  • “其他网站”是什么意思?
  • 我有 25 个网站,我需要从中获取某些数据,然后抓取这些信息并将其保存到我的数据库中。
  • 我想你需要看看how it works,我不知道我是否回答了你的问题,但你可以使用异步函数一次抓取多个网站。
  • JSoup 看起来像是一个网站解析器,很可能无法满足我的需要,但 JSpider 看起来很有希望。感谢您抽出宝贵时间提供信息。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多