【发布时间】:2014-07-23 00:58:01
【问题描述】:
我想将 nltk.pos_tag 返回的词性 (POS) 用于 sklearn 分类器,如何将它们转换为向量并使用它? 例如
sent = "这是 POS 示例"
tok=nltk.tokenize.word_tokenize(发送) pos=nltk.pos_tag(tok) 打印(位置)
这将返回以下 [('This', 'DT'), ('is', 'VBZ'), ('POS', 'NNP'), ('example', 'NN')]
现在我无法应用任何矢量化器(DictVectorizer,或 FeatureHasher,来自 scikitlearn 的 CountVectorizer 在分类器中使用
请推荐
【问题讨论】:
-
除非您不知道矢量化器的作用,否则您并非“无法”使用它们。
DictVectorizer和FeatureHasher处理得很好,其他人有一点工作。
标签: python machine-learning scikit-learn nltk