【发布时间】:2018-04-25 01:45:28
【问题描述】:
我在文件中有一些文本
<title>Dhind</title>
<title>WT.</title>
<title>Plant Leaves:</title>
<title>Denia;</title>
<title>Erodé</title>
我试图找出在我的文件中结束标记 </title> 之前是否有点、逗号、分号或冒号,除非有一个不代表 4 位十六进制实体的分号。 ..IE。搜索应该会找到以下结果
<title>WT.</title>
<title>Plant Leaves:</title>
<title>Denia;</title>
而不是<title>Erod&#x00E9;</title>,因为“;”是实体代码的一部分,因此被忽略。
我目前正在使用这个正则表达式 string pattern = @"([.,:]|((?<!&#x\w{4});))</title>" 并与之匹配。
有没有更有效的正则表达式模式来做到这一点,我不是很擅长正则表达式...
注意:该文件不是有效的 xml 或 html,因此 xml/html 解析技术在这里没有用处。
【问题讨论】: