【发布时间】:2019-09-05 17:04:03
【问题描述】:
我正在尝试从名为 Elite Prospects (https://www.eliteprospects.com/team/41/jokerit) 的网站上提取一些文本。这是页面的源代码:
<div class="semi-logo">
Jokerit
<small>
<span>
<i> <img class="nation-flag" src="//files.eliteprospects.com/layout/flagsmedium/9.png"> </i>
<a href="https://www.eliteprospects.com/league/khl">KHL</a>
</span>
</small>
</div>
我特别想提取球队名称(在本例中为“Jokerit”),以及位于 a href 标记中的联赛名称。我成功地提取了联赛名称,但是我尝试提取团队名称的方式给了我“JokeritKHL”。我将此代码用于多个示例,因此它还需要能够提取两个单词的团队名称(例如“Guelph Storm”)。
这是我的代码:
team_logo= scraper.find(class_='semi-logo')
team_name = team_logo.getText(strip=True)
league = team_logo.find('a')
league = league.getText()
print(league)
print(team_name)
这是我得到的当前输出:
KHL
JokeritKHL
有什么想法吗?
我想知道有没有办法只获得“Jokerit”部分
【问题讨论】:
标签: python beautifulsoup html-parsing