【发布时间】:2018-09-23 12:29:36
【问题描述】:
我正在使用 doc2vec 对一组教育文档进行聚类。
作为人类,我认为这些属于以下类别:
- 电脑相关
- 语言相关
- 合作
- 艺术
等等
我想知道是否有办法将 doc2vec 聚类“引导”成一组人类可解释的聚类。
我一直在尝试的一个策略是过滤掉所有“无意义”的单词,只训练 doc2vec 看起来有意义的单词。但是,当然,这似乎可能会破坏训练。
我刚刚想到了一些可能有用的事情:
对整个文档进行训练(不要过滤掉单词)以创建 doc2vec 空间
从每个文档中过滤掉无意义的词(“帮助”、“学生”等是在这个空间中意义不大的词)
将过滤后的文档投射到 doc2vec 空间中
然后使用 k-means 等进行处理
如果有任何建设性的建议或后续步骤,我将不胜感激。
最好的
【问题讨论】:
标签: text cluster-analysis word2vec text-classification doc2vec