【问题标题】:WEKA Hierarchical Clustering Output - Leaf identification ambiguityWEKA 层次聚类输出 - 叶识别模糊
【发布时间】:2017-05-15 06:42:51
【问题描述】:

当从 WEKA 调用层次聚类时(我使用 C# 中的 IKVM,但我不认为这很重要,答案可以是任何一种语言),有一个选项可以生成 Newick 格式的树状图,但是当试图解析它,我需要识别叶子并将每个叶子链接到输入中的一个数据(向量)。

例如输入arff为:

@RELATION points


@ATTRIBUTE x REAL
@ATTRIBUTE y REAL

@DATA
1.0,2.0
3.0,1.0
1.0,3.0
2.0,1.0

我会得到以下 Newick 格式的树状图:

((2.0:1,3.0:1):1.49661,(1.0:1,1.0:1):1.49661)

哪里不清楚点是怎么识别的(第一个分支有2和3,但第二个分支有1和1,但不清楚哪个是哪个)。

有没有办法改变这个输出的表示方式,或者在 Newick 输出中以更好的方式添加一个额外的唯一属性标识基准?

【问题讨论】:

  • 我觉得我对输出的理解有误,如果我是这样请告诉我,也许输出不代表每个点而是代表特定的y

标签: java c# weka graph-theory ikvm


【解决方案1】:

找到了解决方案,它可能不适用于所有距离函数,但它适用于 Weka Hierarchical Clustering 的默认配置: 解决方法就是在最后添加一个额外的字符串属性,似乎在所有计算中都被忽略了,这可以包含行或向量的唯一标识,这将被 WEKA 用于输出最终的图形(Newick dendrogram) .

ARFF 示例:

@RELATION points

@ATTRIBUTE x REAL
@ATTRIBUTE y REAL
@ATTRIBUTE id   STRING

@DATA
1,5,100 
2,6,200
3,5,300

这将产生以下 Newick:

(((100:1.41421,200:1.41421):-0.05358,300:1.36064):0.441,400:1.80164)

当忽略最后一个属性时,这将产生完全相同的簇,但叶子的命名不同:

(((5.0:1.41421,6.0:1.41421):-0.05358,5.0:1.36064):0.441,6.0:1.80164)

这是模棱两可的。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2013-05-08
    • 2018-10-10
    • 2012-07-17
    • 2014-04-02
    • 1970-01-01
    • 2021-07-02
    • 2018-10-04
    • 2014-06-28
    相关资源
    最近更新 更多