【发布时间】:2014-12-12 13:28:38
【问题描述】:
有些页面不会在 ajax 上返回原始数据(如 json 或 xml 或 html)。相反,他们使用像 dojo 这样的框架,其中 ajax 调用返回 js 文件,这些文件以某种方式填充 html 节点。
我想知道是否有非 Selenium 策略可以从这些页面中抓取数据。
【问题讨论】:
-
据我所知你需要一个浏览器。如果您不想要硒,请尝试 phantomjs 或类似的。你试过jeanphix.me/Ghost.py吗?
-
@gosom Phantomjs 非常酷,并且在我当前的本地实现中运行良好。缺点是速度很慢。我在将代码部署到 heroku 时也遇到了问题,所以我想知道是否有更好的方法。
标签: python web-scraping