【发布时间】:2021-10-27 21:24:57
【问题描述】:
我正在使用 BeautifulSoup,并在我的文档中找到了一个元素,如下所示:
<p><a id="_Toc374204393"></a><a id="_Toc374204469"></a>Hershey's<sup>®</sup> makes yummy chocolate</p>
我想提取
Hershey's<sup>®</sup> makes yummy chocolate
我知道我可以拿走这个项目并抓住它的.contents,然后如果它不包含<a>,则重新加入文本,但这似乎是一种超级笨拙的方法。我还能如何得到这个文本?使用 get_text() 之类的方法将文本返回给我,但没有我想保留的 <sup> 标记。
【问题讨论】:
-
您是如何继续使用
.contents方法的?我提供的答案比这更好吗? -
.contents会给我类似[a id="_Toc374204393"></a>,<a id="_Toc374204469"></a>,"Hershey's",<sup>®</sup>, "makes yummy chocolate"]的东西,我可以从中迭代并以某种方式删除 a 标签。我想这是一个很好的答案,但似乎有一种方法可以做我想做的事。也许没有。
标签: python html beautifulsoup