【发布时间】:2019-03-11 17:51:51
【问题描述】:
此代码适用于 URL http://www.schulliste.eu/schule/,但不适用于 http://www.schulliste.eu/type/gymnasien/ 有人知道为什么吗?我认为这与关键字“标题”有关 我也喜欢在它们之间使用普通的电子邮件地址(不带括号和引号),这可能吗?
import requests
from bs4 import BeautifulSoup as soup
def get_emails(_links: list, _r=[0, 10]):
for i in range(*_r):
new_d = soup(requests.get(_links[i]).text, 'html.parser').find_all('a', {'class':'my_modal_open'})
if new_d:
yield new_d[-1]['title']
d = soup(requests.get('http://www.schulliste.eu/schule/').text, 'html.parser')
results = [i['href'] for i in d.find_all('a')][52:-9]
print(list(get_emails(results)))
【问题讨论】:
标签: python url beautifulsoup screen-scraping keyword