【发布时间】:2018-10-25 18:07:16
【问题描述】:
假设我有一个单词列表,例如
[['apple','banana'],
['apple','orange'],
['banana','orange'],
['rice','potatoes','orange'],
['potatoes','rice']]
这个集合要大得多。我想对通常一起存在的单词具有相同簇的单词进行聚类。所以在这种情况下,集群将是 ['apple', 'banana', 'orange'] 和 ['rice','potatoes']。
归档这种集群的最佳方法是什么?
【问题讨论】:
-
到目前为止你尝试过什么?通常,“我如何”类型的问题被认为是题外话。此论坛更适合在您遇到特定问题时提供帮助。
-
也许sklearn clustering 是一个开始的地方
-
我正在寻找 sklearn 聚类,但我没有可以执行聚类的值。我也尝试了大表,我注意到每个单词存在多少个不同的单词(例如 t[apple,banana]=1, t[rice,potatoes]=2),但它适用于所有单词(它实际上是笛卡尔product) 很慢,我无法在合理的时间内处理它。
标签: python machine-learning cluster-analysis information-retrieval