【发布时间】:2013-02-23 04:08:30
【问题描述】:
我对 urllib 很熟悉,因为我在课堂上使用它来解析来自 Google 货币转换器的数据,但现在我想创建一个从 nextworth.com 网站获取价格的网络爬虫。
正如您所见,这并不像从一页中获取数据那么简单(就像您获取黄金价格或诸如此类的数据一样),但要显示最终价格,需要回答许多产品和许多问题。这就是它的工作原理:
1.去网站(http://www.nextworth.com)
2.点击产品类别(例如 iPhone)http://nextworth.com/search/1/cat/iphones/
3.点击实物(如iPhone 4 16GB ATT)http://nextworth.com/product/293814/cat/iphones/apple_iphone_4_16gb_(black)_-_at&t/
那么你有一系列的问题,以便给你一个即时报价。因此,接下来的步骤将是
4. 开机全功能 - 是
5. 显示器破裂 - 否
最后,显示价格。这就是我要抓取和存储的内容。现在我正在努力只获得完美状态物品的价格,因为它更容易,但请记住,如果第 4 步为“否”且第 5 步为“否”,或者第 4 步 - 是且第 5 步 - 是,我也想要价格,等等
所以我想我的问题是,为这个程序编写代码背后的伪代码(逻辑步骤)是什么样的?这样做是否可行,还是需要永远和大量的代码行?我是否应该先为每个类别创建几个功能,然后在其中我拥有每个产品(我觉得这将花费很长时间)。还是应该为每个类别和嵌入式函数使用类?
编辑:我想我应该问一下 Python 是否会成为一种很好的语言,希望它是可行的,因为我只知道 Python 和 C++。
【问题讨论】:
标签: python web-scraping