【发布时间】:2019-08-06 16:53:57
【问题描述】:
我正在尝试抓取此页面 (https://www.polarislist.com/) 我正在尝试提取所有数据,例如班级规模、免费/减少午餐/学生/助教比例、按种族划分的学生人口统计百分比,以及普林斯顿大学承认的麻省理工学院、哈佛大学的相应人数。
但是,当我查看并检查页面源时,我无法找到包含此类信息的标签
我正在使用 Python 3.7,Bs4 我已经检查了页面来源
到目前为止我有什么:
#importing lbiraries
import requests
import bs4
from bs4 import BeautifulSoup
page_link = 'https://www.polarislist.com'
page_response = requests.get(page_link, timeout=5)
page_content = BeautifulSoup(page_response.content, "html.parser")
result_name_of_hs = page_content.find_all('div', attrs={'data-test': 'name'})
print(result_name_of_hs)
***输出为[]
我希望 BS4 能够获取已识别的标签并将其从站点中提取出来。但是,当我在 Inspect Page 元素中时,我找不到任何东西,
我在检查元素时看到了这一点,但无法获取 div 数据测试名称
<div class="font-size-20 font-weight-semi-bold block-with-text" data-test="name">THOMAS JEFFERSON HIGH SCHOOL</div>
【问题讨论】:
-
很确定该网站是用 react 构建的。顺便说一句,有一个 json 端点。你会感兴趣吗?
https://www.polarislist.com/api/high_schools_orange_cake
标签: python html web-scraping beautifulsoup scrapinghub