【发布时间】:2012-02-17 02:30:38
【问题描述】:
我想编写一个正则表达式,它将匹配使用某种 Unicode 编码编码的文本中特定字符的所有重音形式,而无需在字符类中明确列出所有此类形式。
因此,例如,如果我想匹配 a 的任何重音版本,[aàáâãäå] 是不够的,因为它只获得了 ISO-8859-1 中的 a,并且很可能是那里没有出现的其他口音。可以接受的东西是\p{Base_Character: a},如果在Unicode中定义了这样的东西。确实存在这样的东西吗?
编辑:我无法先将字符串 ASCII 化 --- 该字符串位于我无法直接访问的数据库中。事实上,我在这里没有任何代码级访问权限。我能给出的唯一输入是一个正则表达式。
【问题讨论】: