【发布时间】:2021-03-12 14:05:14
【问题描述】:
我正在使用the example in the documentation 之后的 scikit-learn 进行文本分类。
为了提取特征,即将文本转换成一组向量,示例使用了HashingVectorizer和TfidfVectorizer向量器。
为了处理同一个词的不同词干,我在向量化器之前进行词干化。也就是说,我希望将“运行”和“运行”映射到相同的向量。
我想知道将word2vec model 用作矢量化器是否有优势。我认为这可以让我处理同义词,即将具有相同含义的不同单词映射到向量空间中彼此非常接近的向量。
我的推理是否正确,或者以下 KMeans 聚类算法将为我处理同义词?
【问题讨论】:
-
人们使用词嵌入的全部原因是它们通常可以更好地表示像你这样的任务。
标签: cluster-analysis word2vec feature-extraction tf-idf tfidfvectorizer