【发布时间】:2022-01-16 12:28:11
【问题描述】:
我有一些大数据框,它们大到足以在我的机器上突破 R 的极限;例如,我目前正在处理的是 2 列乘 7000 万行。内容不重要,但以防万一,第 1 列是字符串,第 2 列是整数。
我想做的是将该数据帧拆分为 n 个部分(例如,20 个,但最好是可以根据具体情况进行更改的部分),以便我可以处理每个较小的数据帧一次。这意味着(a)结果必须产生命名的东西(例如,“newdf_1”、“newdf_2”、...“newdf_20”或其他东西),并且(b)原始数据框中的每一行都需要是在一个(也是唯一一个)新的“子”数据帧中。顺序无关紧要,但按行顺序执行对我来说很有意义。
一旦我完成这项工作,我将开始一次将它们重新组合(使用rbind())一对。
我查看了split(),但据我所知,它旨在处理因子(我没有)。
有什么想法吗?
【问题讨论】:
-
我建议使用带有打开文件连接的
readLines一次读取几行,根据需要处理它们,然后按顺序保存输出。见这里:stackoverflow.com/questions/12626637/…
标签: r dataframe data-manipulation large-data