【发布时间】:2020-02-22 07:45:00
【问题描述】:
我正在尝试对包含大约 1,100,000 个观察值的数据集进行聚类,每个观察值具有三个值。
R中的代码很简单:
df11.dist <-dist(df11cl) ,其中 df11cl 是具有三列和 1,100,000 行的数据框,并且此数据框中的所有值都是标准化的。
我得到的错误是:
Error: cannot allocate vector of size 4439.0 Gb
针对类似问题的建议包括增加 RAM 或分块数据。我已经有 64GB RAM,而我的虚拟内存是 171GB,所以我不认为增加 RAM 是一个可行的解决方案。此外,据我所知,分层数据分析中的分块数据会产生不同的结果。因此,使用数据样本似乎是没有问题的。
我也找到了this solution,但答案实际上改变了问题。他们在技术上建议 k-means。如果事先知道集群的数量,K-means 就可以工作。我不知道集群的数量。也就是说,我使用不同数量的集群运行 k-means,但现在我不知道如何证明选择一个到另一个是合理的。有什么可以帮助的测试吗?
您能推荐R 或python 中的任何内容吗?
【问题讨论】:
-
请添加您的完整错误回溯和与问题相关的代码。
标签: python r bigdata cluster-analysis