【发布时间】:2020-11-13 15:37:17
【问题描述】:
我的汤数据如下所示。
<a href="/title/tt0110912/" title="Quentin Tarantino">
Pulp Fiction
</a>
<a href="/title/tt0137523/" title="David Fincher">
Fight Club
</a>
<a href="blablabla" title="Yet to Release">
Yet to Release
</a>
<a href="something" title="Movies">
Coming soon
</a>
我需要来自a 标签的文本数据,可能是href=/title/*wildcharacter*
我的可能有点像这样。
titles = []
for a in soup.find_all("a",href=True):
if a.text:
titles.append(a.text.replace('\n'," "))
print(titles)
但在这种情况下,我会从所有 a 标记中获取文本。我只需要href 具有"/title/***" 的文本。
【问题讨论】:
标签: python pandas beautifulsoup