【发布时间】:2021-09-19 19:27:18
【问题描述】:
我在使用 BeautifulSoup4 时遇到问题。
我正在尝试在特定 div 下的某个 html 页面 (https://www.gov.br/pt-br/servicos/infrabr) 上查找每个链接,这是我的代码:
for a in soup.find(class_='col-servico').find_all(href = True):
print(a['href'])
这是我感兴趣的 html 块(它在 div class=col-servico 内部):
<div class="servico_fieldset_outras_conteudo">
<p style="text-align: justify; ">Agora, o Sistema Eletrônico do Serviço de Informação (e-SIC) está integrado
ao <span><a href="http://fala.BR" class="linkified" target="_blank">Fala.BR</a></span>.
Desenvolvida .</p>
<p style="text-align: justify; ">Em conformidade com
a
<span><a class="external-link"
href="http://www.planalto.gov.br/ccivil_03/_ato2011-2014/2011/lei/l12527.htm" target="_blank" title=""
data-tippreview-enabled="false" data-tippreview-image="" data-tippreview-title="">
你可以看到这个块有两个'a'标签:
<span><a href="http://fala.BR" class="linkified" target="_blank">Fala.BR</a></span>
<span><a class="external-link"
href="http://www.planalto.gov.br/ccivil_03/_ato2011-2014/2011/lei/l12527.htm" target="_blank" title=""
data-tippreview-enabled="false" data-tippreview-image="" data-tippreview-title="">
但我的结果是只带了一个:
http://www.planalto.gov.br/ccivil_03/_ato2011-2014/2011/lei/l12527.htm
如您所见,它只返回“planalto.gov.br”网址,而不是“fala.BR”网址。我看不出这两个“a”标签之间有什么区别,我不知道为什么它没有返回第一个链接。有人可以帮帮我吗?
【问题讨论】:
标签: python html beautifulsoup