【问题标题】:Cluster binary data集群二进制数据
【发布时间】:2012-11-12 03:50:24
【问题描述】:

我有一个包含 BINARY 用户/项目特征矩阵的大型数据集:

  1. 我需要对用户和项目进行聚类。无论如何在 Mahout 中同时执行它们吗?
  2. 更重要的是,如果我使用对数似然作为相似性度量,什么聚类 算法实际上会支持这样的距离度量来对数据进行聚类吗?

【问题讨论】:

    标签: data-mining binary-data mahout


    【解决方案1】:

    不,用户和项目的聚类是独立的过程。虽然在精神上它是完全相同的过程,只是应用了两种不同的方式。

    如果您想在 Mahout 中获得更具体的答案,则必须详细说明您正在使用代码的哪些部分,因为有几个不同的部分涉及集群。

    项目中有一些凝聚聚类部分,适用于任何相似性度量。我知道的其他实现肯定是“k-means”种类,假设一个连续的向量空间而不是超过 {0,1} 的向量。我认为你需要一种 k-medoids 算法,而这不在我所知道的项目中。

    【讨论】:

    • 谢谢 Sean,您能否更具体地了解 Mahout 中的凝聚集群部分。我正处于设计阶段,需要知道我是否有相似度矩阵,以及基于此度量对数据进行聚类的好的聚类算法。
    • 我在想TreeClusteringRecommender,这是我编写的旧的非分布式代码,并不是我特别推荐给任何人的东西。但由于它不是基于质心的,您只需要一个相似度度量。一般来说,您的问题的答案是“k-medoids”。
    猜你喜欢
    • 2014-06-05
    • 2019-11-25
    • 2011-01-12
    • 2021-06-30
    • 2021-09-18
    • 2017-11-13
    • 2016-12-29
    • 2021-05-21
    • 2020-06-06
    相关资源
    最近更新 更多