【发布时间】:2012-11-12 03:50:24
【问题描述】:
我有一个包含 BINARY 用户/项目特征矩阵的大型数据集:
- 我需要对用户和项目进行聚类。无论如何在 Mahout 中同时执行它们吗?
- 更重要的是,如果我使用对数似然作为相似性度量,什么聚类 算法实际上会支持这样的距离度量来对数据进行聚类吗?
【问题讨论】:
标签: data-mining binary-data mahout
我有一个包含 BINARY 用户/项目特征矩阵的大型数据集:
【问题讨论】:
标签: data-mining binary-data mahout
不,用户和项目的聚类是独立的过程。虽然在精神上它是完全相同的过程,只是应用了两种不同的方式。
如果您想在 Mahout 中获得更具体的答案,则必须详细说明您正在使用代码的哪些部分,因为有几个不同的部分涉及集群。
项目中有一些凝聚聚类部分,适用于任何相似性度量。我知道的其他实现肯定是“k-means”种类,假设一个连续的向量空间而不是超过 {0,1} 的向量。我认为你需要一种 k-medoids 算法,而这不在我所知道的项目中。
【讨论】:
TreeClusteringRecommender,这是我编写的旧的非分布式代码,并不是我特别推荐给任何人的东西。但由于它不是基于质心的,您只需要一个相似度度量。一般来说,您的问题的答案是“k-medoids”。