【发布时间】:2017-04-18 09:30:01
【问题描述】:
我正在尝试找到一种从 utf8 文本文件中过滤表情符号的方法。显然有一个可用的 javascript 正则表达式 (https://raw.githubusercontent.com/mathiasbynens/emoji-regex/master/index.js) 可用于匹配表情符号。我无法将此正则表达式翻译成 c# 方言(看起来有一些我不明白的差异)。然后我尝试按照简单的代码来匹配我的文本中的所有非单词和非空格字符(手动检查它们并选择表情符号,然后将它们放入正则表达式并用空字符串替换它们)。
string input = @"some path\";
List<char> emojis = new List<char>();
foreach(FileInfo file in new DirectoryInfo(input).GetFiles("*.txt", SearchOption.AllDirectories))
{
MatchCollection matches = Regex.Matches(File.ReadAllText(file.FullName), @"[^\w\s]{1}");
foreach(Match match in matches)
{
string value = match.Value;
foreach(char c in value.ToCharArray())
{
if(!emojis.Contains(c))
{
emojis.Add(c);
}
}
}
}
foreach(char c in emojis)
{
File.AppendAllText(@"\\Emojis.txt", c.ToString()+"|");
}
但我在#develop 中遇到异常
System.Text.EncoderFallbackException:无法翻译 Unicode 指定代码页索引 0 处的字符 \uD83D。
显然将正则表达式匹配的字符转换为字符不是一个好主意。有什么想法可以解决这个问题吗? 问候
【问题讨论】:
-
您可以使用 Javascript 正则表达式模式,方法是将每个
\u替换为\x,以及将开头附近的\*替换为\\* -
我认为 \x 或 \u 没有区别。我尝试了两种方式。使用 \x 抛出异常'[x-y] range in reverse order'。使用 \u 会引发异常“十六进制数字不足”。
-
这个正则表达式单词在 javascript 在线正则表达式测试器中。所以必须改变一些东西才能使它与 c# 一起工作。也许添加十六进制对来补偿高于 64000 的字符值或什么?
-
什么是抛出异常?我在测试程序中使用该模式,完全使用我在之前评论中解释的差异。
-
我使用了以下在#develop 中引发异常的代码。正则表达式 regex = new Regex(@"", RegexOptions.Compiled);有和没有编辑。没有任何变化。
标签: javascript c# regex emoji