【问题标题】:Combining huge data sets in R在 R 中组合大量数据集
【发布时间】:2022-01-18 14:52:15
【问题描述】:

我不熟悉在 R 中处理大量数据集。因此,我感谢任何帮助 我有 20 年的数据,每年三个 .csv 文件,每个文件大小约为 3 GB 我尝试使用函数 list.files() 将文件名存储在向量中 现在我知道理论上我需要沿着这个向量循环来读取文件并一个一个地生成积分并组合文件。但我不知道如何循环并组合我的数据集或运行不同的模型!!!!我经常收到错误“错误:无法分配大小为 3.4 Gb 的向量”或“内存已用尽,已达到限制”!!!!!!! 如果有人可以指导我,我将不胜感激。 此致 萨拉

【问题讨论】:

    标签: r loops memory large-data


    【解决方案1】:

    您应该确保您的计算机有足够的 RAM 内存和存储空间来处理这些数据量。 fread() 是一个非常有用的函数,可以快速整理数据。试试看:https://www.rdocumentation.org/packages/data.table/versions/1.14.2/topics/fread.

    如果这不起作用,请尝试使用 spark。它非常快速、方便和简单。您无需知道,只需查看此备忘单 (https://ugoproto.github.io/ugo_r_doc/pdf/sparklyr.pdf)。祝你好运!

    【讨论】:

    • 感谢您的帮助。我的笔记本电脑有 16 GB 的 RAM。现在我尝试在每次加载数据后通过 gc() 清理内存,然后继续下一步。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2011-09-23
    • 2015-01-31
    • 2019-12-15
    • 2020-12-06
    相关资源
    最近更新 更多