【发布时间】:2012-05-31 20:33:13
【问题描述】:
我的任务是在 SAS 服务器上运行 K-Means 聚类算法,但内存不足。数据集是 500G,我知道我可以对其进行采样以适应内存,但如果我想在整个数据上运行模型,Oracle R Enterprise (ORE) 会帮助解决我的问题吗?
有关ORE和ORCH的其他相关问题:
- Oracle R 软件包是否包含任何聚类算法?是否有可用的 Oracle R 软件包列表?
- 如果我在 Oracle R Enterprise 中运行 kmeans 算法(R CRAN 包),我是否也会遇到内存问题?
- BDA 中是否有任何可用的 R 集群包,可用于在分布式 Hadoop 集群上运行?
谢谢
【问题讨论】:
-
无需支付甲骨文。我会以每核 10,000 美元的超低价来做!
-
作为旁注,请查看 Thomas Jungblut 关于在纯 Hadoop 中实现 k-means 的帖子 - codingwiththomas.blogspot.com/2011/05/…
-
等等 Chris,这不是 500G 的生产用途,这会更糟。请采用 Mahout 实现。