【发布时间】:2020-10-10 00:39:10
【问题描述】:
我正在尝试抓取启用了 java 脚本的网页内容。我需要在该网站的表格中提取数据。然而,表格的每一行都有按钮(箭头),我们可以通过它获得该行的附加信息。
我需要提取每一行的附加描述。通过检查可以看出,每一行的那些箭头的内容属于同一类。但是,该类隐藏在源代码中。只有在检查时才能观察到。我试图稀疏的数据来自webpage。
我用过硒和美丽的汤。我能够抓取表格的数据,但不能抓取表格中那些箭头的内容。我的 python 正在为该箭头的类返回一个空列表。但适用于普通表数据的类。
from bs4 import BeautifulSoup
from selenium import webdriver
browser = webdriver.Firefox()
browser.get('https://projects.sfchronicle.com/2020/layoff-tracker/')
html_source = browser.page_source
soup = BeautifulSoup(html_source,'html.parser')
data = soup.find_all('div',class_="sc-fzoLsD jxXBhc rdt_ExpanderRow")
print(data.text)
【问题讨论】:
标签: python selenium web-scraping beautifulsoup screen-scraping