【发布时间】:2016-03-10 12:12:34
【问题描述】:
我使用 python 的文本 blob 库,以及文本 blob 的朴素贝叶斯分类器。我了解到它使用 nltk 朴素贝叶斯分类器。这是问题:我的输入句子是非英语的(土耳其语)。有可能吗?我不知道它是如何工作的。但我尝试了 10 个训练数据,似乎奏效了。我想知道它是如何工作的,这个 nltk 的天真的宝贝分类器,在非英语数据上。有什么缺点?
【问题讨论】:
-
分类器对大多数非英语数据的工作方式应该相同。当然,这种分类算法的效果部分取决于语言(除其他外)。例如,语言是否高度屈折?你能准确地标记语言吗? (某些语言,例如那些缺少空格的语言,是出了名的难以标记化。)
-
土耳其语形态丰富,但使用拉丁字母,用空格分隔单词。
标签: python nltk naivebayes textblob