【问题标题】:How to subset RData file that is too large for memory?如何对内存太大的 RData 文件进行子集化?
【发布时间】:2014-07-31 17:05:12
【问题描述】:

我有一个 RData 文件太大而无法使用 load() 命令加载到我的计算机上。它包含一个包含约 300 万个观测值和约 100 个变量的数据框。

我想要

  • 加载文件,可能使用一些 bigdata 或 ff 包(但我不知道这些是如何工作的)
  • 去掉一些变量以减小文件大小
  • 将其保存为带有常规数据框的 Rdata 文件(不是一些奇怪的“大数据”类型对象)
  • 使用 load() 加载压缩文件并恢复常规 R 操作

我该怎么办?

【问题讨论】:

  • 如果 data.frame 不适合内存,那么你就不走运了。您是如何创建文件的?
  • 在更好的(64 位)计算机上。
  • 好吧,然后回到那里并保存为文本文件或数据库。
  • 启动一个 AWS 实例并首先加载它,然后将其打包。
  • 我还没有尝试过,所以我将其作为评论留下。但我认为archivist 包 (cran.r-project.org/package=archivist) 可以在这里提供帮助。见:smarterpoland.pl/index.php/2014/09/lazy-load-with-archivist

标签: r memory bigdata


【解决方案1】:

上周 Jared Lander(“R for Everyone”一书的作者)帮助在 bigboards.io hex 上创建 R 色调。我们在其上安装了 RStudio Server,并使用了 hex 的全部存储/处理能力。 Ceph 用于在节点上分发数据

不管怎样,这感觉就像是你的问题的解决方案。

【讨论】:

  • Tint 和 Hex 是 BigBoards 公司的专有术语,根据 bigboards-docs.readthedocs.org/en/stable 表示“软件”和“六边形硬件设备……一个由 6 个节点组成的集群 [每个节点都有自己的 CPU]”。这个答案有点不清楚,或多或少相当于上面的 cmets,“获得更好的计算机”并使用 RStudio Server。教程/链接到更多信息?
猜你喜欢
  • 2020-04-22
  • 2014-03-06
  • 2014-11-17
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2017-09-06
  • 1970-01-01
  • 2011-09-23
相关资源
最近更新 更多