【发布时间】:2021-11-17 14:17:58
【问题描述】:
我正在尝试从“GlassDoor”中抓取大诺伊达的科技公司名单:
但是 问题:页面在加载几秒钟后改变了它的内容(可能使用了 javascript)。
您可以更改链接中页面的值.. 尝试一下。 更改页码后我正在渲染相同的第一页内容..更改页码后。!
from bs4 import BeautifulSoup
from selenium import webdriver
lst=[]
options = webdriver.ChromeOptions()
options.add_argument('--headless')
browser = webdriver.Chrome(options=options, executable_path='chromedriver.exe')
browser.get("https://www.glassdoor.co.in/Explore/browse-companies.htm?overall_rating_low=3.5&page=8&isHiringSurge=0&locId=4475367&locType=C&locName=Greater%20Noida")
html = browser.page_source
soup = BeautifulSoup(html, features="html.parser")
company_lst = soup.find_all('section', {'class': 'employerCard__EmployerCardStyles__employerCard'})
for item in company_lst:
d={}
d['Name'] = item.find('h2', {'data-test': 'employer-short-name'}).text
d['Rating'] = item.find('span', {'data-test': 'rating'}).text
d['Reviews-Count'] = item.find('div', {'data-test': 'cell-Reviews-count'}).text
d['Salaries-Count'] = item.find('div', {'data-test': 'cell-Salaries-count'}).text
d['Jobs-Count'] = item.find('div', {'data-test': 'cell-Jobs-count'}).text
d['Industry'] = item.find('span', {'data-test': 'employer-industry'}).text
print(d['Name'])
【问题讨论】:
标签: javascript python selenium python-requests webdriver