【发布时间】:2022-11-21 22:49:21
【问题描述】:
在我工作的公司,他们即将从遗留的 DB2 数据库迁移到 Snowflake。
Database Configuration for Database DWPROD
Database territory = US
Database code page = 819
Database code set = ISO8859-1
LANG=en_US
目标数据库已默认配置,即 UTF-8 排序规则。
在将数据加载到 Snowlake 之前,已经需要修剪所有文本列,因为尾随空格会导致某些连接出现问题。 (在 DB2 方面,整理负责处理它)
我现在已经意识到另一个明显的排序问题:
使用 UTF-8 的 Snowflake 在小写字母之前对大写字母进行排序(首先是 A-Z,然后是 a-z)。另一方面,DB2 在 b、B 等之前对 a、A 进行排序。
我试图找到更多的例子来说明可能会出现什么问题,这样我就可以展示它们来阻止这种疯狂。
我已经收集了上面列出的问题的示例。 我期待(梦想)从对整理、unicode 有很多经验的有经验的人那里得到一些答案。有些人可能会说这是关于基本的东西。但是现在似乎每个人都忽略了它。当此类迁移失败或需要重做时,在这里分享一些故事也很棒。
【问题讨论】:
标签: database snowflake-cloud-data-platform collation