【问题标题】:How a clustering algorithm in R can end up with negative silhouette values? ABR中的聚类算法如何以负轮廓值结束? AB
【发布时间】:2016-06-01 03:36:34
【问题描述】:

我们知道 R 中的聚类方法将观察结果分配给最近的中心点。因此,它应该是每个观察可以拥有的最近的集群。所以,我想知道 silhouette 怎么可能有负值,而我们应该将每个观察值分配给最近的集群,而剪影方法中的公式不能得到负值?

贝南。

【问题讨论】:

    标签: cluster-analysis silhouette


    【解决方案1】:

    两个错误:

    1. 大多数聚类算法不使用中心点,只有 PAM 使用。

    2. 轮廓不使用到中心点的距离,而是使用到所有集群成员的平均距离。如果最近的聚类非常,则平均距离可能大于到中心点的距离。考虑一个集群,其中一个点位于中心,所有其他点位于其周围的球体上。

    【讨论】:

    • 非常感谢。您是否有更好的算法来处理大型数据集?我正在使用 Clara,但实际上我仍然不能使用大于 10,000 的样本量,而且我无法在不试错的情况下选择样本量和数量。
    • K-means 是最具可扩展性的,其次可能是 DBSCAN。
    • 我对 kmeans 和所有需要构建大型相异矩阵的算法有同样的问题。
    • 它们都不需要大的距离矩阵。
    猜你喜欢
    • 2018-12-25
    • 2015-07-27
    • 2012-01-14
    • 2018-01-21
    • 2019-01-03
    • 2018-02-18
    • 2019-07-14
    • 2017-11-20
    • 1970-01-01
    相关资源
    最近更新 更多