【发布时间】:2019-09-22 11:26:00
【问题描述】:
我想从 Booking.com 上抓取一些酒店信息。该网站提供了一些酒店信息,在这种特殊情况下,还有多少房间可用。下面显示了来自 Booking.com 网站的 span 标签,我只想提取所有列出的酒店的 data-x-left-count 数量。
<span class="only_x_left sr_rooms_left_wrap " data-x-left-count="6">
Nur noch 6 Zimmer auf unserer Seite verfügbar!
</span>
我试图通过查找元素并返回一个硒对象数组来接近它。
availabilities_element = browser.find_elements_by_xpath("(//span[contains(.,'nur noch')])[2]")
然后是一个列表理解来获取实际的酒店标题,而不是 selenium 对象。
availabilities = [x.text for x in availabilities_element]
但我在获取数据方面仍有一些问题。我希望得到可用房间的列表(只是数字,仅此而已)。有没有一种干净简单的解决方案?
【问题讨论】:
-
试用 API:developers.booking.com/api/index.html。我确信抓取他们的网站违反了 TOS。
标签: python selenium xpath web-crawler