【问题标题】:What's the difference between utf8_unicode_ci and utf8mb4_0900_ai_ciutf8_unicode_ci 和 utf8mb4_0900_ai_ci 有什么区别
【发布时间】:2019-02-26 12:04:30
【问题描述】:

mysql中utf8mb4_0900_ai_ciutf8_unicode_ci数据库文本编码有什么区别(特别是在性能方面)?

更新:

utf8mb4_unicode_ci 和 utf8mb4_0900_ai_ci 有类似的区别吗?

【问题讨论】:

  • 这些是排序规则,控制数据的排序方式。 mbX 表示多字节(X 字节存储一个字符),0900 是排序算法,ai 表示不区分重音,ci 表示不区分大小写

标签: mysql unicode


【解决方案1】:
  • 编码是一样的。也就是说,字节看起来是一样的。
  • 字符集不同。 utf8mb4 有更多字符。
  • 排序规则(如何进行比较)不同。
  • 性能是不同的,但它并不重要。

utf8_unicode_ci 表示CHARACTER SET utf8,它仅包含 1、2 和 3 字节的 UTF-8 字符。因此它排除了大多数表情符号和一些汉字。

utf8mb4_unicode_ci 意味着 CHARACTER SET utf8mb4 是对应于 4 字节 CHARACTER SET utf8mb4COLLATION

Unicode 组织多年来一直在发展规范。以下是从其“版本”到 MySQL 排序规则的映射:

4.0   _unicode_
5.20  _unicode_520_
9.0   _0900_

大多数差异将出现在大多数人从未遇到过的领域。一个例子:在某些时候,一项更改允许以某种方式区分和排序表情符号。

后缀(MySQL doc):

_bin      -- just compare the bits; don't consider case folding, accents, etc
_ci       -- explicitly case insensitive (A=a) and implicitly accent insensitive (a=á)
_ai_ci    -- explicitly case insensitive and accent insensitive
_as (etc) -- accent-sensitive (etc)

性能:

_bin         -- simple, fast
_general_ci  -- fails to compare multiple letters; eg ss=ß, so somewhat fast
...          -- slower
_900_        -- (8.0) much faster because of a rewrite

但是:整理速度通常是查询中性能问题中最少的。 INDEXesJOINs、子查询、表扫描等对性能更为关键。

【讨论】:

  • utf8mb4_unicode_ciutf8mb4_0900_ai_ci 之间有相似的区别吗?
  • @KamilKiełczewski - 是的。
  • @BugWhisperer - "utf8mb4" 的最大 字符 是 4 个字节。这适用于所有 utf8mb4 排序规则(“utf8mb4_*,包括那个)。
  • @Stalinko - 来自 OracleOpenWorld。一位开发人员指出,8.0 对排序规则代码进行了很大的重写,并指出它要快得多。 (我还没有设计一个实际的测试用例来验证或量化加速。)
  • @Stalinko - 测量转换前后的时间。让我们知道。
猜你喜欢
  • 2013-09-25
  • 2021-12-05
  • 2010-11-05
相关资源
最近更新 更多