【问题标题】:Unicode range mapping between languages语言之间的 Unicode 范围映射
【发布时间】:2011-07-19 11:15:43
【问题描述】:

此链接http://www.sil.org/iso639-3/download.asphttp://en.wikipedia.org/wiki/ISO_639:a 中列出了7707 种语言。

而且 Unicode 也支持语言的书写系统,但我想知道语言和 unicode 范围之间的映射。

Unicode 范围列在此链接http://www.unicode.org/roadmaps/bmp/

unicode 范围的示例之一:“start”=>“0x0900”、“end”=>“0x097F”、“block_name”=>“Devanagari”(什么语言使用这个 unicode 范围?)

有任何文件吗?我需要 unicode 范围内支持的完整语言映射。

【问题讨论】:

  • 脚本到语言不是一对一的映射。您会将'a' 映射到哪里?充其量您可以构建脚本到语言的多对多映射并查找匹配集。像Onmiglot 这样的东西可能是一个有用的资源。
  • 是的,多对多映射。谢谢你的链接,很有帮助,有完整的清单吗?
  • 我不知道任何将脚本映射到语言的标准化列表或资源。就是说,我还没有认真考虑过这个特定的问题,所以它很可能存在,但我想知道这是否有用。实际上并没有一种通用的文本方式来发现文本的语言,而且大多数现实世界的文本可能甚至没有明确定义的单一语言(只要看看任何德国广告)。从代码点发现脚本很好;除此之外的任何事情都是更高级别协议的责任,例如 HTML 的 lang 属性。

标签: unicode


【解决方案1】:

您可以查看 ICU4C 语言环境 (http://icu-project.org/apiref/icu4c/uloc_8h.html)

您可以获取所有语言环境(使用 uloc_getAvailable),然后为每个语言环境调用 uloc_addLikelySubtags,然后对结果调用 uloc_getScript。

这将为您提供一种语言最有可能使用的脚本。但是有些语言使用多个脚本。其中一些被 ICU 捕获,而另一些则不是。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-06-12
    • 1970-01-01
    • 2016-10-01
    • 2018-08-11
    • 2023-01-09
    • 2017-11-03
    • 2020-03-03
    • 1970-01-01
    相关资源
    最近更新 更多