【发布时间】:2020-05-04 16:08:48
【问题描述】:
我正在尝试编辑一本翻译不佳的书。
我的文本中有很多不必要的 p 标签。我想找到引号内的所有 p 标签,如本文所示:“…Hmm. </p>Is… That, really so…?” 并删除那些 p 标签。
我设法想出了一个正则表达式来找到这样的句子 (\“.*</p>.*\”),但我无法想象一个人只选择 </p> 内的引号而没有其他文本,这样我只需单击一下即可将它们全部替换。请发送帮助。
edit1:将所有单词“括号”更改为“引号”。
【问题讨论】:
-
“括号内”,您的示例似乎表明您的意思是“双引号内”?
-
是的,我的意思是“内引号”。我的错。
-
这比看起来要复杂。您正在删除结束 标记,但如果您不删除相应的开始
标记,您最终会得到无效的 HTML。有时这并不重要,但它可能会影响格式。
-
您可能可以使用前瞻和后瞻来一步完成,但我可能只分两步完成。首先找到引号,然后删除 p 作为第二步。
-
这能回答你的问题吗? Strip HTML from strings in Python
标签: python regex text-parsing