【发布时间】:2014-06-10 12:32:16
【问题描述】:
我正在尝试从包含由 javascript 生成的 html 的网页中获取源代码。我目前的代码如下:
from selenium import webdriver
from bs4 import BeautifulSoup
case_url = "http://na.leagueoflegends.com/tribunal/en/case/5555631/#nogo"
try:
browser = webdriver.Firefox()
browser.get(case_url)
url = browser.page_source
print url
browser.close
except:
...
soup=BeautifulSoup(url)
...extraction code that finds the right tags, but they are empty...
当我打印存储在 url 中的源时,它会打印通常的 HTML,但缺少生成的 html 信息。如何获得与按 f12 时相同的 HTML(但我更愿意以编程方式执行此操作)?
【问题讨论】:
标签: python python-2.7 selenium html-parsing beautifulsoup