【发布时间】:2020-08-27 22:01:15
【问题描述】:
我目前正在做短文本聚类,并从这个github link 实现了 gsdmm,数据集大小为 2675,词汇大小为 1231。
但是,聚类结果不是很准确,我认为这可能是因为数据集包含在我正在研究的领域中具有不同含义的相似单词/短语。
具有不同含义的相似短语示例:
"business process management", "business process modelling" and "business model canvas"
"process workflow model", "process orientation" and "process innovation"
我尝试过使用二元组和三元组,但没有解决问题。
还有其他方法可以改善结果吗?有没有其他适合短文本聚类的算法?
【问题讨论】:
标签: cluster-analysis