【问题标题】:DBSCAN choice of epsilon through elbow methodDBSCAN 通过弯头法选择 epsilon
【发布时间】:2021-12-28 19:22:35
【问题描述】:

我不确定为什么肘法是确定 DBSCAN 算法的 epsilon 值的近似正确方法。例如,在下面的示例中:

我考虑了与第 5 个最近邻的距离,并将点从具有最小 5 邻距离的点排列到与第 5 邻距离最大的点。

我认为该情节是欧几里得距离。

所以我知道例如点 0-20 是最接近其第 5 个最近邻的点,那么肘部中的点是距其第 5 个最近邻的中间距离的点,因此它们具有中等密度。然后我们到达密度非常低的点,远离它们的第 5 个最近邻。

但我不明白为什么选择 epsilon 的值作为肘部中第 k 个最近邻点之间的距离是合理的。

感谢您的帮助。

【问题讨论】:

    标签: dbscan


    【解决方案1】:

    来自论文dbscan: Fast Density-Based Clustering with R(第11页)

    为了找到合适的 eps 值,我们可以绘制点的 kNN 距离(即每个点到其第 k 个最近点的距离 邻居)按降序排列并在图中寻找膝盖。这 这种启发式背后的想法是位于集群内部的点 将有一个小的 k-最近邻距离,因为它们很近 到同一簇中的其他点,而噪声点更多 孤立并且会有相当大的kNN距离。

    我们需要一个截止值来决定什么 k-NN 距离被认为是“小”,什么是“大”。膝部启发式将 epsilon 的这种截断识别为 k-NN 距离,其中距离开始快速增加。

    【讨论】:

    • 谢谢,现在清楚一点了。我仍然不明白为什么我们将 k 与我们使用的最小点数相等,将核心点与边界/噪声点分开
    猜你喜欢
    • 2020-12-27
    • 2018-06-11
    • 2019-06-15
    • 2016-02-01
    • 1970-01-01
    • 2018-04-22
    • 2018-03-21
    • 2014-04-21
    • 2012-10-05
    相关资源
    最近更新 更多