【发布时间】:2014-02-23 14:56:19
【问题描述】:
注意:我是新手。这在手头的问题中很明显。
我需要从以下网站获取等待时间:
https://www.floridahospital.com/locations/er-wait-times
我尝试通过 XPath 和 lmxml 以及通过 DOM 和 BeautifulSoup 进行抓取。有人告诉我,因为这些值没有加载到源代码中,所以它们是用 Javascript 呈现的。所以,我研究了用 Python 抓取 JS 元素。
对我来说,Selenium 看起来有点过头了,因为我不需要点击任何东西——内容加载,而不是直接在我可以抓取的 HTML 中。 PhantomJS 需要用 JS 编写,我读到有人在将其移植到 AWS 或非 GUI 服务器时遇到问题。
我看过 Ghost.py,它看起来与 BS4 兼容,所以可能是最简单的。
获取这些等待时间的最简单方法是什么?他们是在加载 JS 吗?
另外,如果你的回答会让一个蹒跚学步的孩子感到困惑,那很可能是我 - 所以请记住这一点 :)
【问题讨论】:
标签: javascript python xpath web-scraping beautifulsoup