【问题标题】:Clustering similar texts using Affinity Propagation and creating a cluster plot使用 Affinity Propagation 对相似文本进行聚类并创建聚类图
【发布时间】:2018-06-18 10:42:48
【问题描述】:

我有一个要根据相似性进行聚类的大学列表。例如,这个字符串“University of Melbourne”和这个字符串“University of Meelbourne”是一样的,但是有拼写错误。

我想使用 Affinity Propagation (Scikit Learn) 技术将这些相似的字符串组合在一起。在 SciKit learn 上应用 Affinity Propagation 之前,我是否需要先使用 Word2VEC 转换字符串?

有没有好的教程可以告诉我如何做到这一点?

【问题讨论】:

  • 我建议您在应用聚类算法之前进行预处理。比如停用词、词干提取、词形还原等,
  • 是否有一种好方法(可能使用特定的 Python 库)根据我拥有的列表将所有相似的大学名称组合在一起?
  • 我认为没有这样的python库。但是您可以尝试在预处理后找到文本之间的文本相似性将简化您的问题

标签: python string text cluster-analysis


【解决方案1】:

不要滥用聚类进行拼写纠正!

Word2vec 将无法工作。

它的词汇表中没有“Meelbourne”,因为这是一个罕见的拼写错误。所以它会忽略这个词!对于 BOW 方法,它也没有帮助。

这只是集群无法解决的问题。请改用拼写校正器。

【讨论】:

    猜你喜欢
    • 2018-04-19
    • 2018-02-23
    • 2015-07-20
    • 2014-10-28
    • 2020-02-16
    • 1970-01-01
    • 2018-01-07
    • 2019-09-01
    • 1970-01-01
    相关资源
    最近更新 更多