【问题标题】:crawler in multiple websites of sales多个销售网站的爬虫
【发布时间】:2013-01-02 10:23:59
【问题描述】:

这是我的总体思路:在多个销售网站(例如 ebay)中搜索以找到 ipad 2 在上个月的平均价格。

我只想要一些指导来做这样的事情。语言可以是PHP或Python,可以使用开源项目。

问题是这样的系统至少需要一些自定义参数,例如日期间隔和对象名称。

那么我需要为每个网站定制一个爬虫吗?

如何将价值与产品联系起来?

我在使用这些销售网站时可能会遇到哪些问题?

嗯,我真的需要一些关于如何正确执行类似操作的建议。

【问题讨论】:

  • 尝试编写爬虫并然后询问您是否有特定问题。另外,我会使用 Ebay API 而不是抓取 Ebay。
  • @Blender ebay 只是一个例子。我需要一个总体思路,现阶段我没有具体问题。
  • 那么你的问题是什么?如果您倾向于使用 Python,请查看 Scrapy
  • @Blender 来自有类似经验的人的一些建议。

标签: php python web-crawler


【解决方案1】:

所以我可能需要为每个网站定制一个爬虫?

不,您需要为每个网站定制它的某些方面,但底层引擎将保持不变。而且您只需要一些信息,因此您必须对其进行自定义才能获得这些信息。

如何将价值与产品联系起来?

您只是抓取了这些数据,由您来管理它的这方面。但是,如果您正在抓取产品 X,那么您会保留该产品的价格列表,并(例如)对该列表的内容进行平均以获得平均价格。您如何将该列表关联到产品取决于您的底层数据库实现。

我可以对这些销售网站有一些问题吗?

是的,当然,如果网站发生变化,那么您的抓取工具可能会停止工作。这就是为什么最好始终使用 API 的原因,因为这样您就不必依赖页面结构不变来获取您的内容。

嗯,我真的需要一些关于做某事的正确方法的建议 类似。

使用 API 优先于通过 HTML 进行选择。使用现有工具,而不是重新发明轮子。 http://wwwsearch.sourceforge.net/mechanize/

http://scrapy.org/

http://seleniumhq.org/

Amazon API library for Python?

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2012-09-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-12-29
    • 2011-01-11
    • 1970-01-01
    相关资源
    最近更新 更多