【问题标题】:Replacing all html tags with newlines (or spaces)用换行符(或空格)替换所有 html 标记
【发布时间】:2018-11-23 10:54:56
【问题描述】:

我想弄清楚如何用换行符替换所有 html 标记。

我有一个包含信息的 csv 文件,但我不想要 html。如果我得到文本而不是显示 html,则返回的字符串被连接起来(使用下面的示例,它将返回 ActingDirectingIntroduction 到 ActingCollege WritingIntroductiong 到写作)。

我希望能够将所有 html 标记(<...> 内的任何内容)替换为换行符。任何帮助将不胜感激,例如下面!

<ul>
<li>
 Acting
</li>
<li>
 Directing
</li>
<li>
 Introduction to Acting
</li>
<li>
 College Writing
</li>
<li>
 Introduction to Writing
</li>
</ul>

【问题讨论】:

  • 拨打soup.get_text()

标签: python html python-2.7 beautifulsoup


【解决方案1】:

这是使用优秀库lxml.html的方法

import lxml.html
document = lxml.html.document_fromstring(html_string)
print(document.text_content())

这里是相关文档http://lxml.de/lxmlhtml.html#html-element-methods

【讨论】:

猜你喜欢
  • 1970-01-01
  • 2013-06-19
  • 1970-01-01
  • 2010-12-23
  • 2013-11-03
  • 1970-01-01
  • 2015-04-11
  • 2014-06-03
  • 1970-01-01
相关资源
最近更新 更多