【发布时间】:2012-10-04 02:14:21
【问题描述】:
获取由 Javascript 创建的页面中的所有 HTML 以传递给 BeautifulSoup 的最佳方法是什么?
我目前正在使用:
from selenium import webdriver
from selenium.common.exceptions import NoSuchElementException
from selenium.webdriver.common.keys import Keys
from BeautifulSoup import BeautifulSoup
browser = webdriver.Firefox()
browser.get("http://www.yahoo.co.uk")
html = browser.find_elements_by_id("html")
但是“html”总是一个空列表。我做错了什么?
【问题讨论】:
-
Selenium 几乎可以完成 BeautifulSoup 所做的所有事情——您甚至可以直接访问和操作 javascript 创建的对象。硒绑定与漂亮的汤绑定也没有太大区别。
标签: python selenium screen-scraping beautifulsoup