【发布时间】:2015-12-19 13:52:39
【问题描述】:
我有一个 TF-IDF 特征向量数组。我想使用两种方法在数组中找到相似的向量:
- 余弦相似度
- k 均值聚类
使用 Scikit Learn,这个过程非常简单。
现在我想对某些特征进行加权,以便它们对结果的影响比其他特征更大。例如,我可能希望对 TF-IDF 向量的前 100 个元素进行加权,以便这些特征比其余特征更能指示相似性。
如何在我的特征向量中对某些特征进行有意义的加权?对于我上面列出的每个相似性算法,对某些特征进行加权的过程是否相同?
【问题讨论】:
标签: python machine-learning scikit-learn k-means tf-idf