【发布时间】:2018-09-14 13:17:56
【问题描述】:
我是机器学习的新手,现在我对根据语义相似性进行文档聚类(不同长度的短文本)感兴趣(我只是想超越标准的 TF/IDF 方法)。我阅读了http://proceedings.mlr.press/v37/kusnerb15.pdf 的论文,其中解释了 Word Mover 的词嵌入距离。在论文中,他们将其用于分类。我现在的问题是 - 我可以将它用于集群吗?如果是这样,是否有一篇论文描述了这种用法?
PS:我基本上对考虑语义相似性的聚类感兴趣,所以即使是 word2vec 或 doc2vec 方法也可以完成这项工作 - 我只是找不到任何用于聚类问题的论文。
【问题讨论】:
标签: cluster-analysis similarity unsupervised-learning