【发布时间】:2012-06-11 03:53:35
【问题描述】:
这个问题可能是堆栈溢出的边界,所以如果它看起来过于离题,我提前道歉。我正在编写一个涉及多种语言的程序,我需要一个将 languages 映射到 Unicode 点的表。熟悉 Unicode 的人都知道,字符被划分为“块”,例如拉丁文、西里尔文等。当然,大多数使用拉丁字符的语言并不使用 all 拉丁字符,并且大多数使用西里尔字符的语言不使用 all 西里尔字符等。我对仅将英语映射到英语中使用的字符、西班牙语映射到西班牙语中使用的字符的表感兴趣,等等。没有必要涵盖世界上的所有语言(因为这几乎是不可能的),但至少需要涵盖一些更常见的语言。 (即便如此,这将是一个涉及多对多关系的相当广泛的表。)我不确定这样的表是否存在。 (如果没有,我可能会将它变成一个开源项目,因为它对我和其他人都非常有用。)
【问题讨论】:
-
您要达到的目标是什么?您不应将特定语言的用户限制在特定的子曲目中;有些瑞典人的名字中有法语 è,有些法国人使用德语借词,有些人混合使用多种语言,甚至在同一份文件中。对于语言识别,比单个字符更长的序列可能更有用;看看 CPAN 的 Language::Guess 模块,它结合了 Unicode 块信息和传统的 n-gram 语言分类器。 mailman.uib.no/public/corpora/2011-April/012879.html