【问题标题】:How to normalize all special characters but umlauts?如何规范化除变音符号以外的所有特殊字符?
【发布时间】:2014-08-24 06:02:36
【问题描述】:

我想规范化任何扩展的 ascii 字符,但不包括变音符号。

如果我想包含变音符号,我会选择:

Normalizer.normalize(value, Normalizer.Form.NFKD)
    .replaceAll("\\p{InCombiningDiacriticalMarks}+", "");

但是如何排除德语变音符号呢?

因此我想得到:

来源:üöäâÇæôøñÁ

想要的结果:üöäaCaeoonA 或类似

【问题讨论】:

  • 规范化扩展字符是什么意思?
  • â -> a 例如。这就是规范器的作用。
  • 只是一个想法:首先用不受规范化影响的其他东西替换变音符号(及其分解形式!),进行规范化,然后将它们替换回来。
  • 您想通过这种标准化实现什么目标?这是你期待的结果吗?归一化后的 U+00E2 实际上不是 U+0061 U+005E,而不仅仅是 U+0061(其他情况也是如此)?
  • 是的,这是我想要的结果,但不知道如何。

标签: java unicode normalization matcher unicode-normalization


【解决方案1】:

从这里我看到了 2 个解决方案,我猜第一个很脏,第二个实现起来很无聊。

【讨论】:

  • 第三种选择是将输入字符串拆分为变音字符,将其间的部分标准化,然后将其加入。
【解决方案2】:
// Latin to ASCII - mostly
private static final String TAB_00C0 = "" +
        "AAAAÄAACEEEEIIII" +
        "DNOOOOÖ×OUUUÜYTß" +
        "aaaaäaaceeeeiiii" +
        "dnooooö÷ouuuüyty" +
        "AaAaAaCcCcCcCcDd" +
        "DdEeEeEeEeEeGgGg" +
        "GgGgHhHhIiIiIiIi" +
        "IiJjJjKkkLlLlLlL" +
        "lLlNnNnNnnNnOoOo" +
        "OoOoRrRrRrSsSsSs" +
        "SsTtTtTtUuUuUuUu" +
        "UuUuWwYyYZzZzZzs";

private static HashMap<Character, String> LIGATURES = new HashMap<>(){{
    put('æ', "ae"); 
    put('œ', "oe");
    put('þ', "th");
    put("ij", "ij");
    put('ð', "dh");
    put("Æ", "AE");
    put("Œ", "OE");
    put("Þ", "TH");
    put("Ð", "DH");
    put("IJ", "IJ");
    //TODO
}};

public static String removeAllButUmlauts(String value) {
    value = Normalizer.normalize(value, Normalizer.Form.NFC);
    StringBuilder sb = new StringBuilder();
    for (int i = 0; i < source.length(); i++) {
        char c = source.charAt(i);
        String  l = LIGATURES.get(c);
        if (l != null){
            sb.append(l);
        } else if (c < 0xc0) {
            sb.append(c); // ASCII and C1 control codes
        } else if (c >= 0xc0 && c <= 0x17f) {
            c = TAB_00C0.charAt(c - 0xc0); // common single latin letters
            sb.append(c);
        } else { 
            // anything else, including Vietnamese and rare diacritics
            l = Normalizer.normalize(Character.toString(c), Normalizer.Form.NFKD)
                    .replaceAll("[\\p{InCombiningDiacriticalMarks}]+", "");
            sb.append(l);
        }

    }
    return sb.toString();
}

然后

String value = "üöäâÇæôøñÁ";
String after = removeAllButUmlauts(value);
System.out.println(after)

给予:

üöäaCaeoonA

【讨论】:

  • 函数应该命名为removeAllButGermanUmlauts。很难看出它是否这样做,但这就是问题所要求的。德语变音符号是“üöä”(大写和小写)。
猜你喜欢
  • 2017-09-22
  • 2013-04-25
  • 1970-01-01
  • 1970-01-01
  • 2011-06-15
  • 2017-06-18
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多