【问题标题】:Improving short text cluster performance提高短文本集群性能
【发布时间】:2020-08-27 22:01:15
【问题描述】:

我目前正在做短文本聚类,并从这个github link 实现了 gsdmm,数据集大小为 2675,词汇大小为 1231。

但是,聚类结果不是很准确,我认为这可能是因为数据集包含在我正在研究的领域中具有不同含义的相似单词/短语。

具有不同含义的相似短语示例:

"business process management", "business process modelling" and "business model canvas"
"process workflow model", "process orientation" and "process innovation"

我尝试过使用二元组和三元组,但没有解决问题。

还有其他方法可以改善结果吗?有没有其他适合短文本聚类的算法?

【问题讨论】:

    标签: cluster-analysis


    【解决方案1】:

    你玩过 GSDMM 算法的参数吗?当我使用具有不同 alpha 和 beta 值的算法时,我的结果发生了巨大变化。因此,如果您知道预期的集群数量,您可以寻找位于正确区域的 alpha beta 组合。 如果您没有这些信息,我建议您尝试不同的值并比较结果。

    除了 GSDMM,我不知道任何短文本聚类算法。

    【讨论】:

      猜你喜欢
      • 2010-10-09
      • 2021-11-05
      • 2023-04-10
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多