【问题标题】:Scraping Price Data from Product Catalog on a Website [closed]从网站上的产品目录中抓取价格数据[关闭]
【发布时间】:2013-02-23 04:08:30
【问题描述】:

我对 urllib 很熟悉,因为我在课堂上使用它来解析来自 Google 货币转换器的数据,但现在我想创建一个从 nextworth.com 网站获取价格的网络爬虫。

正如您所见,这并不像从一页中获取数据那么简单(就像您获取黄金价格或诸如此类的数据一样),但要显示最终价格,需要回答许多产品和许多问题。这就是它的工作原理:

1.去网站(http://www.nextworth.com)

2.点击产品类别(例如 iPhone)http://nextworth.com/search/1/cat/iphones/

3.点击实物(如iPhone 4 16GB ATT)http://nextworth.com/product/293814/cat/iphones/apple_iphone_4_16gb_(black)_-_at&t/

那么你有一系列的问题,以便给你一个即时报价。因此,接下来的步骤将是

4. 开机全功能 - 是

5. 显示器破裂 - 否

最后,显示价格。这就是我要抓取和存储的内容。现在我正在努力只获得完美状态物品的价格,因为它更容易,但请记住,如果第 4 步为“否”且第 5 步为“否”,或者第 4 步 - 是且第 5 步 - 是,我也想要价格,等等

所以我想我的问题是,为这个程序编写代码背后的伪代码(逻辑步骤)是什么样的?这样做是否可行,还是需要永远和大量的代码行?我是否应该先为每个类别创建几个功能,然后在其中我拥有每个产品(我觉得这将花费很长时间)。还是应该为每个类别和嵌入式函数使用类?

编辑:我想我应该问一下 Python 是否会成为一种很好的语言,希望它是可行的,因为我只知道 Python 和 C++。

【问题讨论】:

    标签: python web-scraping


    【解决方案1】:

    Webscraping 库需要您设置某种形式的库以及集成开发环境,您正在考虑为此选择 python。

    我们创建了一个网页抓取即服务平台,让您可以automate webscraping in a few click。虽然我们仍在创建 chrome 浏览器扩展程序,但我们将在本周末发布其第一个版本。您只需要编写几行 JSON,就可以使用我们为您进行网络抓取。

    【讨论】:

      【解决方案2】:

      对于一般的网站抓取,您可以使用一个不错的webscraping module。好消息是它可以利用 QtWebkit 模块,因此您甚至可以处理 javascript 繁重的网站。

      考虑到这一点,尽管我必须在这类事情上警告你。

      您正在做的是一个自动化流程,根据您的要求,它看起来好像要访问很多页面。如果您没有从您要报废的网站获得许可,您可能会被他们的服务器阻止,因为您使用了可能吸引他们关心的实时人类客户的资源。

      在这些情况下,您需要处理某种 API。看看网站是否有 API,因为这些对自动化流程更友好很多,只要你遵守他们的 API 规则。

      【讨论】:

      • 感谢您的警告,不幸的是我认为他们没有公共 API。也许它不像我想象的那样可行。
      • @Goose 我会联系他们看看。如果你真的只是为了学习,解释一下。他们也可能正在开发一个 API,或者他们自己使用另一个 API。可能发生的最糟糕的情况是他们拒绝了您的请求。如果您真的想了解一些更高层次的实用内容,请查看AWS API python bindings。这是一项高度适销对路且有用的技能。
      • @Goose 嗯,我认为您应该看看 Python 和较低级别的网络。我把 together a guide 放在 Python 文档中,其中有推荐的部分。一旦你明白了这一点,我会再次考虑解决 AWS 的问题。
      猜你喜欢
      • 1970-01-01
      • 2014-05-04
      • 1970-01-01
      • 2021-01-07
      • 1970-01-01
      • 2021-06-28
      • 2022-01-08
      • 2022-01-23
      • 2012-02-28
      相关资源
      最近更新 更多