【问题标题】:Is there any Python module that helps to crawl data from DOM loaded by Javascript?是否有任何 Python 模块可以帮助从 Javascript 加载的 DOM 中抓取数据?
【发布时间】:2012-04-28 05:14:58
【问题描述】:

我想从使用 Ajax 调用加载 DOM 元素的页面中抓取数据。

我已尝试使用基于 PyQt4 的旧解决方案线抓取,它在 DOM 完全加载后加载它,但问题是我需要执行 POST 请求,并且它仅适用于 GET。

新的 Python 模块 ghost.py 存在超时问题:当它获取大型 DOM 树时会引发超时异常。

如果有人知道任何特定的方式或工具可以帮助我在完全加载 DOM 后执行 POST 请求并获取数据,那将对我有很大帮助。

【问题讨论】:

    标签: python web-crawler web-scraping


    【解决方案1】:

    您可以使用Selenium 自动化浏览器和访问dom。 Selenium 具有 python 驱动程序,因此您可以在 python 中编写代码以导航到页面。单击按钮并等待 ajax 调用完成,然后再开始报废。

    【讨论】:

    • 我对Selinium知之甚少,但是它会通过浏览器自动加载网页。由于我的爬虫需要在服务器中运行,使用它有什么技术困难吗?
    • @arnold Selenium 有一个快速的 Web 驱动程序界面,它支持使用集线器在机器网格上分配工作。
    【解决方案2】:

    为了模拟 Javascript 和自动化浏览器,我推荐`Spynner。您可以在有或没有 Xserver 的情况下运行它,并且语法非常易于使用。你也可以加载jquery。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-06-16
      • 1970-01-01
      • 1970-01-01
      • 2013-08-09
      • 1970-01-01
      • 2013-07-13
      相关资源
      最近更新 更多