【问题标题】:Regex find all p tags inside quotes without other text正则表达式查找引号内的所有 p 标签,没有其他文本
【发布时间】:2020-05-04 16:08:48
【问题描述】:

我正在尝试编辑一本翻译不佳的书。

我的文本中有很多不必要的 p 标签。我想找到引号内的所有 p 标签,如本文所示: “…Hmm. </p>Is… That, really so…?” 并删除那些 p 标签。 我设法想出了一个正则表达式来找到这样的句子 (\“.*</p>.*\”),但我无法想象一个人只选择 </p> 内的引号而没有其他文本,这样我只需单击一下即可将它们全部替换。请发送帮助。

edit1:将所有单词“括号”更改为“引号”。

【问题讨论】:

  • “括号内”,您的示例似乎表明您的意思是“双引号内”?
  • 是的,我的意思是“内引号”。我的错。
  • 这比看起来要复杂。您正在删除结束 标记,但如果您不删除相应的开始

    标记,您最终会得到无效的 HTML。有时这并不重要,但它可能会影响格式。

  • 您可能可以使用前瞻和后瞻来一步完成,但我可能只分两步完成。首先找到引号,然后删除 p 作为第二步。
  • 这能回答你的问题吗? Strip HTML from strings in Python

标签: python regex text-parsing


【解决方案1】:
(?<=\“(.|\n)*)(<\/p>)(?=(.|\n)*\”)

【讨论】:

  • 它可以按我的意愿工作,但你可以让它也多行吗? (有些地方没有修改)
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2022-07-01
  • 1970-01-01
  • 1970-01-01
  • 2017-07-24
  • 1970-01-01
相关资源
最近更新 更多