【发布时间】:2018-06-18 10:42:48
【问题描述】:
我有一个要根据相似性进行聚类的大学列表。例如,这个字符串“University of Melbourne”和这个字符串“University of Meelbourne”是一样的,但是有拼写错误。
我想使用 Affinity Propagation (Scikit Learn) 技术将这些相似的字符串组合在一起。在 SciKit learn 上应用 Affinity Propagation 之前,我是否需要先使用 Word2VEC 转换字符串?
有没有好的教程可以告诉我如何做到这一点?
【问题讨论】:
-
我建议您在应用聚类算法之前进行预处理。比如停用词、词干提取、词形还原等,
-
是否有一种好方法(可能使用特定的 Python 库)根据我拥有的列表将所有相似的大学名称组合在一起?
-
我认为没有这样的python库。但是您可以尝试在预处理后找到文本之间的文本相似性将简化您的问题
标签: python string text cluster-analysis