【发布时间】:2015-02-14 06:07:59
【问题描述】:
我正在尝试从包含大约 1000 个 cmets 的 csv 文件中构建我的特征向量。我的特征向量之一是使用 scikit learn 的 tfidf 矢量化器的 tfidf。也使用计数作为特征向量是否有意义,或者我应该使用更好的特征向量吗?
如果我最终使用 Countvectorizer 和 tfidfvectorizer 作为我的功能,我应该如何将它们都放入我的 Kmeans 模型(特别是 km.fit() 部分)?目前我只能将 tfidf 特征向量拟合到模型中。
这是我的代码:
vectorizer=TfidfVectorizer(min_df=1, max_df=0.9, stop_words='english', decode_error='ignore')
vectorized=vectorizer.fit_transform(sentence_list)
#count_vectorizer=CountVectorizer(min_df=1, max_df=0.9, stop_words='english', decode_error='ignore')
#count_vectorized=count_vectorizerfit_transform(sentence_list)
km=KMeans(n_clusters=num_clusters, init='k-means++',n_init=10, verbose=1)
km.fit(vectorized)
【问题讨论】:
标签: python machine-learning scipy scikit-learn feature-extraction