【发布时间】:2012-11-20 06:35:42
【问题描述】:
我是 R 的新用户,正试图摆脱 SAS。我在这里问这个问题是因为我对所有可用于 R 的软件包和源代码感到有些沮丧,而且我似乎主要由于数据大小而无法使其正常工作。
我有以下几点:
本地 MySQL 数据库中名为 SOURCE 的表,具有 200 个预测器特征和一个类变量。该表有 300 万条记录,大小为 3GB。每个类的实例数不相等。
我想:
- 随机抽样 SOURCE 数据库以创建一个较小的数据集 每个类具有相同数量的实例。
- 将样本分成训练集和测试集。
- 在训练集上执行 k 均值聚类以确定每个类的 k 个质心。
- 使用质心对测试数据进行 k-NN 分类。
【问题讨论】:
-
欢迎来到!我建议你:RMysqlite 包来提取你的数据,sample 函数(base 包)进行采样! kmeans * 函数(base 包)! *knn 函数(类包)
-
如何处理大数据?数据库的问题,预采样被保存在内存中。只有 4Gb 内存。
-
尝试使用db引擎执行随机选择:stackoverflow.com/q/580639/269476.
-
@entropy 你看过
ff包吗?数据类型ffdf类似于data.frame,但存储在磁盘而不是内存中。 -
你的意思是'k-nn分类测试数据与质心'。这不是 k-nn 的常用工作方式,您通常只提供 k- 邻居数而不是类的质心。你在想一些 k-nn 的变体吗?
标签: r machine-learning k-means knn large-data