【问题标题】:How can I capture the same text multiple times using regex?如何使用正则表达式多次捕获相同的文本?
【发布时间】:2021-07-29 16:41:51
【问题描述】:

我需要匹配字符串之前出现的字符。字符串可能出现多次,这意味着字符可能会改变。

测试对象:

§aUsername: Message, which happens to contain Username. §3Wow, Username again.

我想要三个组,因为Username 在主题中出现了三次。

期望的输出:

["Username", 'a']
["Username", 'a']
["Username", '3']

我写了这个正则表达式,但它只适用于 Username 的一次出现。

我的(失败的)尝试:

§(.).*?Username

编辑:该正则表达式完全忽略了第二次出现的 Username,它应该与第一个匹配相同的字符 (a)。

它的输出:

["Username", 'a']
["Username", '3']

【问题讨论】:

  • 您确定您提出的输出正确吗?
  • 据我所知,使用正则表达式没有简单的方法。您要求解析器创建两个相同但独立的匹配项,这几乎违背了正则表达式的基本原理。你所要求的当然是很有可能的,但正则表达式绝对不是这项工作的工具。
  • 我会说它是否有效。对于大多数实际应用程序,简单地遍历一个字符串,无论出于何种意图和目的,都是瞬时的。老实说,在它真正成为一个问题之前,我不会开始微优化性能,否则你会无缘无故地让自己发疯。根据您使用的语言,可能有一些内置函数可以帮助您入门。例如,您可以找到所有出现的“用户名”和“§”并从那里开始工作,而不是自己循环遍历每个字符。
  • @CharlieArmstrong 是的,我对性能非常偏执,现在我越来越认真地制作其他人必须使用的东西!这是我想出的,以防将来有人好奇:gist.github.com/jxxe/83bbc81c9b1f6c3cfd3a8b8f262b484a
  • @jxxe 这就是我在 Java 中的实现方式,对我来说看起来像是清晰、可读和可理解的代码。干得好。

标签: regex


【解决方案1】:

如果支持后视中的量词(.NET、Pyton PiPy 模块或更新的 Javascript 引擎),您可以在后视中使用捕获组。

匹配将是用户名,组 1 将包含一个任何字符,除了换行符。

(?<=§(.)[^§]*)Username
  • (?&lt;= 正面向后看,断言左边是什么
    • §(.) 匹配 § 并在 group 1 中捕获单个 any char
    • [^§]* 匹配除§ 之外的任何字符,使用否定字符类,任意次数
  • ) 近距离观察
  • Username 字面匹配

Regex demo

【讨论】:

  • 虽然这不是我最终采用的路线,但对于将来来到这里的任何人来说,它在正则表达式中都可以正常工作。编辑:它不适用于 Java 的默认库,所以无论如何我都不会使用它,但它仍然是一个很好的答案!
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多