【发布时间】:2012-10-16 03:52:15
【问题描述】:
我是 R 新手。我正在尝试在大约 50K 项上运行 hclust()。我有 10 列要比较和 50K 行数据。当我尝试分配距离矩阵时,我得到:“无法分配 5GB 的向量”。
这个有大小限制吗?如果是这样,我该如何做这么大的事情?
编辑
我最终增加了 max.limit 并将机器的内存增加到 8GB,这似乎已经解决了。
【问题讨论】:
-
我想知道您是否正在尝试对行进行聚类?如果是这样,那么您正在尝试制作一个 50k * 50k 距离矩阵(矩阵中的 2.5e9 个项目)。这将大于 R 所允许的(任何一个向量或矩阵中最多 2^31 - 1 个项目)。
-
我得到了一个可以使用的数据集,我需要知道它们之间的关系。我应该应用一些过滤器吗?
-
分层聚类,当幼稚地实现时,复杂度为
O(n^3)。因此,甚至不要考虑将其用于大型数据集。
标签: r cluster-analysis data-mining hclust