【问题标题】:In DBSCAN, what does eps represent actually?在 DBSCAN 中,eps 实际上代表什么?
【发布时间】:2015-07-05 09:28:46
【问题描述】:

假设我已经找到了所有密度的 eps。我应用了这里的方法http://ijiset.com/v1s4/IJISET_V1_I4_48.pdf

如果您不介意,请打开第 5 页并查看建议算法部分。在步骤 10.1,论文告诉我们计算 eps-neighborhood 中的对象数量。

eps 实际上代表什么?画圆是半径吗?那么,为什么半径这么小,比两个物体之间的距离还小呢?如果是这样,MinPts 将永远为 0。

【问题讨论】:

    标签: cluster-analysis data-mining dbscan


    【解决方案1】:

    是的,如果与欧几里得距离一起使用,那么它是一个半径。

    它不是无限小(它确实不趋向于 0)。与数据集扩展相比,它应该很小,但作者可以将其命名为“r”。

    使用原始论文来理解算法,而不是它的一些印度期刊变体。

    【讨论】:

    • 那么,你推荐什么纸?我一直在搜索直到现在,我猜超过 5 篇论文,但仍然得到相同的问题
    • 您链接的论文中的参考文献 1。 Ester, Kriegel, Sander, Xu, KDD 1996
    • 我现在明白了,但这里没什么问题。为什么 Weka 取非常小的 eps 值?原始论文建议使用“大”的 k-dist(p) 值,因为点之间的距离大于 eps。那我该怎么办?
    • Weka 适合分类,但不要用于聚类。但我不同意:default 值 0.9 并不是“非常小”,特别是因为它在将每个属性缩放到 [0:1] 后使用了距离。对于一维数据,0.9 大约占数据集的 90%,太大了。但显然这个参数根本不应该有默认值。
    • 我主要使用 ELKI 进行集群,因为它很快;对于许多算法来说,根本没有其他工具可以实现。太糟糕了它缺乏分类,但幸运的是我不需要经常分类。我很想看到 ELKI 的分类。
    【解决方案2】:

    在欧几里得距离中,它是半径。每股收益的选择有点困难。

    这个问题与模型选择有关,即特定模型的选择及其相应的参数化。在 k-means 的情况下(需要用户输入集群的数量),文献中有大量的措施可以帮助选择最佳的集群数量,例如:剪影、c-index ,邓恩,戴维斯-博尔丁。这些衡量标准就是所谓的相对有效性标准。

    对于基于密度的聚类算法,也有一些度量,例如:CDbw 和 DBCV。

    【讨论】:

      猜你喜欢
      • 2010-09-24
      • 1970-01-01
      • 1970-01-01
      • 2015-09-19
      • 2021-08-22
      • 2016-06-18
      • 2023-03-15
      • 1970-01-01
      • 2018-01-08
      相关资源
      最近更新 更多