【问题标题】:Using ELKI, having troubles with dimensions higher than 14使用 ELKI,尺寸大于 14 有问题
【发布时间】:2015-05-28 10:57:52
【问题描述】:

我正在尝试在 ELKI 中使用 SUBCLU,但为了解决问题,我尝试了 DBSCAN,甚至 KMEANSLloyd,这样我就知道如何输入高维数据了。不幸的是,我最多只能输入 14 个维度,任何更高的维度,程序开始抱怨我没有为“bubble.scaling”输入参数,即使我很清楚地有。我通过使用格式与“mouse.csv”教程文件类似的 .csv 文件输入数据(这是我首先弄清楚如何输入尺寸大于 1 的数据的方法)。我做错了什么?

【问题讨论】:

  • 开始抱怨“bubble.scaling”参数是没有意义的。这表明它在运行算法之前很久就存在问题,甚至可能在加载数据之前。事实上,看起来 JVM 似乎以某种方式搞砸了,以至于它与类加载器有问题!请提供堆栈跟踪,并尝试标准的调试技术。

标签: cluster-analysis dimensions elki


【解决方案1】:

原来我没有正确格式化 CSV 文件。我需要包含标题,而不是只包含由空格分隔的数据的 CSV 文件。因为我没有使用随机生成的信息,而且我事先不知道集群的数量,所以这就是 CSV 的样子。

## Size: 10
########################################################
1 2 3 4 5 6 7 8 9 10 11 12 13 14
1 2 3 4 5 6 7 8 9 10 11 12 13 14
14 13 12 11 10 9 8 7 6 5 4 3 2 1
14 13 12 11 10 9 8 7 6 5 4 3 2 1

【讨论】:

  • 尽管如此,他们提供的高维数据示例没有这些标题,但神奇地工作得很好。
  • 天堂禁止我的数据像那样工作,但没有我的数据给我一个超出范围的 java 异常。
  • 我总是使用没有标题的文件,超过 14 个维度。我所有的文件“神奇地工作得很好”......确定你的文件中没有一些细微的错误吗?它可以从命令行工作吗?记录了任何错误?
  • ELKI 支持超过 14 的维度没有问题,这是我日常工作的一部分。您使用的是哪个版本,请分享堆栈跟踪! ELKI 有一个高度优化的解析器,它可能仍然包含一些问题。它是开源的,所以你也可以调试它!
  • 我正在使用 elki-0.6.5~20141030。我也在使用包含的 .bat 文件在 Windows 上运行它,所以我不确定这是否会产生任何影响。我认为您可能是对的,在其他地方存在问题,因为它运行正常的时间有一半(我现在已经停止使用 .csv 文件,我正在使用普通的 .txt 文件),而另一半程序在尝试时挂起形象化。这是在将调试设置为 true imgur.com/gsuBJYt 后挂起时显示的内容
【解决方案2】:

我遇到了同样的问题。我的情况是,我的 csv 文件只包含整数列,它们被视为字符串数据类型而不是数字数据类型。通过将 dbc.parser 设置为 CategoricalDataAsNumberVectorParser,outofbounds 错误消失了。

【讨论】:

  • 什么是假数字而不是“真正的数字”列?!?
  • @HasQUIT--Anony-Mousse:我稍微改变了我的答案,以避免由“真正的数字”一词引起的混淆。
猜你喜欢
  • 1970-01-01
  • 2020-07-30
  • 1970-01-01
  • 2013-03-31
  • 1970-01-01
  • 1970-01-01
  • 2016-08-21
  • 2013-04-17
  • 2012-05-31
相关资源
最近更新 更多