【发布时间】:2020-01-17 14:47:56
【问题描述】:
main_url = 'https://www.indeed.com'
url_to_list = ["https://www.indeed.com/jobs?q=Data%20Scientist&advn=9634682979760233"]
for tab_number in range(1,101):
url_temp = f'https://www.indeed.com/jobs?q=Data+Scientist&start={tab_number}0'
url_to_list.append(url_temp)
url = url_to_list[0]
resp = requests.get(url)
soup = bs4.BeautifulSoup(resp.text, 'html.parser')
#class_titles = soup.findAll("div", {"class": "title"}) #Contains Descrition URL and Title
#class_sjcl = soup.findAll("div", {"class": "sjcl"}) #contains Ratings, company name, area
#class_salarySnippet_holisticSalar = soup.findAll("div",{"class": "salarySnippet holisticSalary"}) #contains pay
main_class = soup.findAll('div', class_='jobsearch-SerpJobCard unifiedRow row result clickcard')
这应该是网络爬虫,但我被卡住了。我希望它给我一个标题、描述等。困难的部分是,如果没有可用的薪水,我希望它返回 None。一切都包含在class_='jobsearch-SerpJobCard unifiedRow row result clickcard'
但是它在每个容器中都有不同的 ID,所以 findAll() 方法返回空。我一直在尝试其他类似问题的解决方案,但它一直返回一个空列表。
【问题讨论】:
标签: python beautifulsoup request