【问题标题】:Is there an advantage in using a word2vec model as a feature extractor for text clustering?使用 word2vec 模型作为文本聚类的特征提取器有优势吗?
【发布时间】:2021-03-12 14:05:14
【问题描述】:

我正在使用the example in the documentation 之后的 scikit-learn 进行文本分类。

为了提取特征,即将文本转换成一组向量,示例使用了HashingVectorizerTfidfVectorizer向量器。

为了处理同一个词的不同词干,我在向量化器之前进行词干化。也就是说,我希望将“运行”和“运行”映射到相同的向量。

我想知道将word2vec model 用作矢量化器是否有优势。我认为这可以让我处理同义词,即将具有相同含义的不同单词映射到向量空间中彼此非常接近的向量。

我的推理是否正确,或者以下 KMeans 聚类算法将为我处理同义词?

【问题讨论】:

  • 人们使用词嵌入的全部原因是它们通常可以更好地表示像你这样的任务。

标签: cluster-analysis word2vec feature-extraction tf-idf tfidfvectorizer


【解决方案1】:

是的,基于 word2vec 的功能有时会提供优势。

但它是否以及如何提供帮助将取决于您的确切数据/目标,以及您在尝试 word2vec 增强方法之前取得的基线结果。您的问题中没有描述或显示这些内容。

scikit-learn example you report as your model 没有集成任何 word2vec 功能。如果添加此类功能会发生什么? (作为一个非常笨拙但简单的示例,如果您替换或连接到 HashingVectorizer 具有一个向量,该向量是所有文本的词向量的平均值。)

通过一些定量分数或粗略的评价,结果是否有所改善?

【讨论】:

  • 第二个问题,我的文本是科学的,我认为在 Google 新闻上预训练的 word2vec 不会在其词汇中包含必要的单词。我可以在我的文本中训练一个词嵌入并将我这样获得的向量作为特征传递吗?
  • 是的,总体而言,使用您自己域的文本来训练您的词向量通常是一个好主意 - 除非出于某种原因 (1) 您的数据很薄并且您认为其他一些外部向量“很好”对于您的域来说已经足够了;或 (2) 您需要与一些更大/更广泛的向量集的坐标兼容性。
猜你喜欢
  • 2020-09-01
  • 2018-10-26
  • 2022-01-17
  • 2015-05-10
  • 2019-08-01
  • 2012-09-02
  • 2019-09-18
  • 2018-02-25
  • 1970-01-01
相关资源
最近更新 更多