【发布时间】:2013-10-30 03:18:19
【问题描述】:
我正在尝试对一串英文文本进行标记,这样我就可以得到一个没有任何标点符号的单词序列,但同时我想留下收缩(比如 don't and won't)和所有格名词(如 Steve's 和 Drew's)完好无损。我正在尝试使用正则表达式来解决这个问题,但我对它们还是陌生的。
基本上,我想要一个正则表达式,它将匹配所有非字母数字字符序列,除了被字母数字字符包围的撇号,例如前面提到的示例。是否可以用正则表达式做到这一点?
【问题讨论】:
-
用 '.匹配后,拆分应如何返回这些单词的详细信息取决于您的语言。
标签: regex tokenize alphanumeric non-alphanumeric