【问题标题】:Memory Management When Reading Multiple Files读取多个文件时的内存管理
【发布时间】:2013-10-03 16:15:56
【问题描述】:

关于读取多个文件和内存管理有很多问题。我正在寻找可以同时解决这两个问题的信息。

我经常需要将数据的多个部分作为单独的文件读取,将它们重新绑定到一个数据集中,然后对其进行处理。到目前为止,我一直在使用类似下面的东西 - rbinideddataset <- do.call("rbind", lapply(list.files(), read.csv, header = TRUE))

我担心在每种方法中都可以观察到的颠簸。这可能是 rbindeddataset 和 not-yet-rbindeddatasets 同时存在于内存中的实例,但我不知道如何确定。有人可以确认吗?

有什么方法可以将预分配原则扩展到这样的任务?或者其他任何人都知道的技巧可能有助于避免这种颠簸?我还在lapply 的结果上尝试了rbindlist,但这并没有显示凹凸。这是否意味着rbindlist 足够聪明来处理这个问题?

data.table 和 Base R 解决方案优于某些软件包的产品。

根据与 @Dwin 和 @mrip 的讨论,于 2013 年 10 月 7 日编辑

> library(data.table)
> filenames <- list.files()
> 
> #APPROACH 1 #################################
> starttime <- proc.time()
> test <- do.call("rbind", lapply(filenames, read.csv, header = TRUE))
> proc.time() - starttime
   user  system elapsed 
  44.60    1.11   45.98 
> 
> rm(test)
> rm(starttime)
> gc()
          used (Mb) gc trigger   (Mb)  max used   (Mb)
Ncells  350556 18.8     741108   39.6    715234   38.2
Vcells 1943837 14.9  153442940 1170.7 192055310 1465.3
> 
> #APPROACH 2 #################################
> starttime <- proc.time()
> test <- lapply(filenames, read.csv, header = TRUE)
> test2 <- do.call("rbind", test)
> proc.time() - starttime
   user  system elapsed 
  47.09    1.26   50.70 
> 
> rm(test)
> rm(test2)
> rm(starttime)
> gc()
          used (Mb) gc trigger   (Mb)  max used   (Mb)
Ncells  350559 18.8     741108   39.6    715234   38.2
Vcells 1943849 14.9  157022756 1198.0 192055310 1465.3
> 
> 
> #APPROACH 3 #################################
> starttime <- proc.time()
> test <- lapply(filenames, read.csv, header = TRUE)
> test <- do.call("rbind", test)
> proc.time() - starttime
   user  system elapsed 
  48.61    1.93   51.16 
> rm(test)
> rm(starttime)
> gc()
          used (Mb) gc trigger   (Mb)  max used   (Mb)
Ncells  350562 18.8     741108   39.6    715234   38.2
Vcells 1943861 14.9  152965559 1167.1 192055310 1465.3
> 
> 
> #APPROACH 4 #################################
> starttime <- proc.time()
> test <- do.call("rbind", lapply(filenames, fread))

> proc.time() - starttime
   user  system elapsed 
  12.87    0.09   12.95 
> rm(test)
> rm(starttime)
> gc()
          used (Mb) gc trigger  (Mb)  max used   (Mb)
Ncells  351067 18.8     741108  39.6    715234   38.2
Vcells 1964791 15.0  122372447 933.7 192055310 1465.3
> 
> 
> #APPROACH 5 #################################
> starttime <- proc.time()
> test <- do.call("rbind", lapply(filenames, read.csv, header = TRUE))
> proc.time() - starttime
   user  system elapsed 
  51.12    1.62   54.16 
> rm(test)
> rm(starttime)
> gc()
          used (Mb) gc trigger   (Mb)  max used   (Mb)
Ncells  350568 18.8     741108   39.6    715234   38.2
Vcells 1943885 14.9  160270439 1222.8 192055310 1465.3
> 
> 
> #APPROACH 6 #################################
> starttime <- proc.time()
> test <- rbindlist(lapply(filenames, fread ))

> proc.time() - starttime
   user  system elapsed 
  13.62    0.06   14.60 
> rm(test)
> rm(starttime)
> gc()
          used (Mb) gc trigger  (Mb)  max used   (Mb)
Ncells  351078 18.8     741108  39.6    715234   38.2
Vcells 1956397 15.0  128216351 978.3 192055310 1465.3
> 
> 
> #APPROACH 7 #################################
> starttime <- proc.time()
> test <- rbindlist(lapply(filenames, read.csv, header = TRUE))
> proc.time() - starttime
   user  system elapsed 
  48.44    0.83   51.70 
> rm(test)
> rm(starttime)
> gc()
          used (Mb) gc trigger  (Mb)  max used   (Mb)
Ncells  350620 18.8     741108  39.6    715234   38.2
Vcells 1944204 14.9  102573080 782.6 192055310 1465.3

正如预期的那样,使用 fread 可以节省最多的时间。但是,方法 4,6 和 7 显示最小的内存开销,我不确定为什么。

【问题讨论】:

    标签: r memory-management data.table


    【解决方案1】:

    看起来rbindlist 预先分配内存并一次性构造新的数据帧,而do.call(rbind) 将一次添加一个数据帧,每次都复制它。结果是rbind 方法的运行时间为O(n^2),而rbindlist 以线性时间运行。此外,rbindlist 应该避免内存增加,因为它不必在每次或n 迭代期间分配新的数据帧。

    一些实验数据:

    x<-data.frame(matrix(1:10000,1000,10))
    ls<-list()
    for(i in 1:10000)
      ls[[i]]<-x+i
    
    rbindtime<-function(i){
      gc()
      system.time(do.call(rbind,ls[1:i]))[3]
    }
    rbindlisttime<-function(i){
      gc()
      system.time(data.frame(rbindlist(ls[1:i])))[3]
    }
    
    ii<-unique(floor(10*1.5^(1:15)))
    ## [1]   15   22   33   50   75  113  170  256  384  576  864 1297 1946 2919 4378
    
    times<-Vectorize(rbindtime)(ii)
    ##elapsed elapsed elapsed elapsed elapsed elapsed elapsed elapsed elapsed elapsed 
    ##  0.009   0.014   0.026   0.049   0.111   0.209   0.350   0.638   1.378   2.645 
    ##elapsed elapsed elapsed elapsed elapsed 
    ##  5.956  17.940  30.446  68.033 164.549 
    
    timeslist<-Vectorize(rbindlisttime)(ii)
    ##elapsed elapsed elapsed elapsed elapsed elapsed elapsed elapsed elapsed elapsed 
    ##  0.001   0.001   0.001   0.002   0.002   0.003   0.004   0.008   0.009   0.015 
    ##elapsed elapsed elapsed elapsed elapsed 
    ##  0.023   0.031   0.046   0.099   0.249 
    

    rbindlist 不仅速度更快,尤其是对于长输入,而且运行时间仅线性增加,而do.call(rbind) 大约呈二次增长。我们可以通过对每组时间拟合一个对数对数线性模型来确认这一点。

    > lm(log(times) ~ log(ii))
    
    Call:
    lm(formula = log(times) ~ log(ii))
    
    Coefficients:
    (Intercept)      log(ii)  
          -9.73         1.73  
    
    > lm(log(timeslist) ~ log(ii))
    
    Call:
    lm(formula = log(timeslist) ~ log(ii))
    
    Coefficients:
    (Intercept)      log(ii)  
       -10.0550       0.9455  
    

    因此,在实验上,do.call(rbind) 的运行时间随着n^1.73 而增长,而rbindlist 大约是线性的。

    【讨论】:

    • +5,如果可以的话。做得太好了。这就是我在我的问题和@DWin 的回答中试图提出的建议,应该是 rbindlist 应该在这里有所作为,而不是 fread。
    • 很好的回应! @Codoremifa,顺便说一句,您可以投票也可以打勾;)
    • 我猜你会发现freadrbindlist 是协同作用的。使用与标准函数相同的标记来命名对象也被认为是一种不好的做法,因此应该禁止使用“ls”。
    【解决方案2】:

    试试这个:

    require(data.table)
    system.time({
    test3 <- do.call("rbind", lapply(filenames, fread, header = TRUE))
                })
    

    您提到了预分配。 fread 确实有一个 'nrows' 参数,但在您预先知道行数的情况下它不会加速其操作(因为它会自动为您预先计算行数,这非常快)。

    【讨论】:

    • fread 在“读取”文件时比 read.table/read.csv 快,但我假设它不能解决内存凸点问题,是吗?
    • 你应该检查一下。我认为它还可以解决困扰 R 操作的一些修改时复制问题,因为 data.table 通过就地修改方法工作。
    • 或者更好的是rbindlist(lapply(filenames, fread))(通常不需要将header指定为TRUEFALSE
    • 我会在周末尝试发布 fread/read.csv X do.callrbind)/rbindlist 组合的结果,但现在我认为@mrip 已经回答了我的问题。
    • 其他结果已发布。在我看来,看起来有点不寻常。大家觉得呢?
    猜你喜欢
    • 1970-01-01
    • 2014-08-16
    • 2019-06-29
    • 2012-08-17
    • 1970-01-01
    • 2021-11-24
    • 2018-12-17
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多