【发布时间】:2016-08-01 00:43:52
【问题描述】:
我正在使用 Beautifulsoup (bs4) 来废弃 HTML 页面。它有列表<ul>,其中有<li>,其中包含一些有趣的链接(href)。
片段:
<ul>
<!-- C 1-3 --></p>
<li>
<a href="http://LINK1" target="_blank">Link1 description</a>
</li>
</ul>
<ul>
<!-- E 1-2-3-6 --></p>
<li>
<a href="LINK-2" target="_blank">Link-2 description</a>
</li>
<p><!-- E 4-5 -7-8-9-10-11 --></p>
</ul>
问题:当我使用find_all() 提取所有<ul> 时 - 由于格式错误的结尾</p> 缺少开头<p>,我没有得到它。浏览器会忽略这一点并呈现正常,但 BS4 会弄乱解析。是否有人试图忽略 BS4 中的任何格式错误的标签(如果存在)?
entries = soup.find_all(lambda x: x.name == 'ul')
print(len(entries))
print(entries[0])
1
<ul>
<!-- C 1-3 --></ul>
【问题讨论】:
标签: python html parsing beautifulsoup