【发布时间】:2021-10-15 01:02:25
【问题描述】:
Code point <-> UTF-8 conversion First code point Last code point Byte 1 Byte 2 Byte 3 Byte 4
U+0000 U+007F 0xxxxxxx
U+0080 U+07FF 110xxxxx 10xxxxxx
U+0800 U+FFFF 1110xxxx 10xxxxxx 10xxxxxx
U+10000 [nb 2]U+10FFFF 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx
表格不清楚,因为u+80二进制是10000000b,这将是无效的(不以110b开头)。我会认为它会是 0xc280?
我的印象是 u+80 - u+bf 都是无效的起始序列。但是,unicode 表声明它们是为一字节控制字符保留的有效代码点。
有人可以帮我澄清一下吗?
【问题讨论】:
标签: unicode-string