【问题标题】:extract price from different e-commerce site using python使用python从不同的电子商务网站提取价格
【发布时间】:2013-07-08 11:48:59
【问题描述】:

当用户在界面中输入书名并显示所有信息时,我需要开发一个网络应用程序,用于从不同的电子商务网站(如 amazon、homeshop18)中提取图书价格。

我的问题是 1)如何将该查询传递给亚马逊网站搜索框,我只能获取与查询相关的页面,而不是抓取整个网站。

2) 可以使用什么来开发此应用程序?BeautifulSoup 还是 scrappy?API 并非所有电子商务网站都可以使用它

我是 python 新手。所以任何帮助都将受到高度赞赏

【问题讨论】:

  • 需要更多信息。您要抓取哪个网站?你试过什么?
  • 任何书籍购物网站。我使用 urllib 模块来获取 html 页面源,不知道如何进一步生成
  • 您可能需要考虑将 BeautifulSoup 用于您的目的。它有助于解析 HTML
  • 为什么要重新发明轮子?已经有一些工具可以做到这一点,比如agenty.com

标签: python python-2.7 e-commerce web-scraping


【解决方案1】:

我个人使用 BeautifulSoup 来解析网页,但要注意如果您必须大量解析页面,它会有点慢。我知道lxml 更快,但对编码器不太友好。要猜测正确的参数(对于 HTTP GET 或 POST)来获取所需的结果页面,您应该这样进行:

  1. 打开 Firefox 的 firebug 插件或 Chrome 的集成检查器
  2. 进入您感兴趣的网页并进行搜索
  3. 进入 firebug/inspector 查看 Firefox 或 Chrome 发送到网站的 HTTP 请求参数。
  4. 在您的 python 脚本中重现该请求。例如使用 urllib

还有另一种猜测正确的 HTTP GET 或 POST 参数的方法,它是使用像 Wireshark 这样的网络分析器。这是一种更详细的方法,但感觉更像 使用 Firefox/Chrome 中的工具后,大海捞针。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2019-06-21
    • 1970-01-01
    • 2023-03-28
    • 2016-03-31
    • 2019-09-11
    • 2017-07-20
    • 1970-01-01
    相关资源
    最近更新 更多