【问题标题】:Optimizing Apply() In R在 R 中优化 Apply()
【发布时间】:2017-12-07 06:11:58
【问题描述】:

以下代码的目标是对具有 400 列和 6000 行的数据集执行递归和迭代分析。在移动到所有可能的组合之前,它一次需要两列并对其执行分析。

正在使用的大数据集的小子集:

  data1       data2       data3      data4
-0.710003   -0.714271   -0.709946   -0.713645
-0.710458   -0.715011   -0.710117   -0.714157
-0.71071    -0.714048   -0.710235   -0.713515
-0.710255   -0.713991   -0.709722   -0.71397
-0.710585   -0.714491   -0.710223   -0.713885
-0.710414   -0.714092   -0.710166   -0.71434
-0.711255   -0.714116   -0.70945    -0.714173
-0.71097    -0.714059   -0.70928    -0.714059
-0.710343   -0.714576   -0.709338   -0.713644

代码使用apply():

# Function
analysisFunc <- function () {

    # Fetch next data to be compared
    nextColumn <<- currentColumn + 1

    while (nextColumn <= ncol(Data)){

        # Fetch the two columns on which to perform analysis
        c1 <- Data[, currentColumn]
        c2 <- Data[, nextColumn]

        # Create linear model
        linearModel <- lm(c1 ~ c2)

        # Capture model data from summary
        modelData <- summary(linearModel)

        # Residuals
        residualData <- t(t(modelData$residuals))

        # Keep on appending data
        linearData <<- cbind(linearData, residualData)

        # Fetch next column
        nextColumn <<- nextColumn + 1

    }

    # Increment the counter
    currentColumn <<- currentColumn + 1

}

# Apply on function
apply(Data, 2, function(x) analysisFunc ())

我认为apply() 将帮助我优化代码,而不是使用循环。不过,似乎没有什么大的影响。运行时间超过两个小时。

有人认为,apply() 的使用方式有问题吗?在apply() 呼叫中使用while() 不是一个好主意吗?还有其他方法可以改进此代码吗?

这是我第一次使用函数式编程。请告诉我您的建议,谢谢。

【问题讨论】:

  • data.table 可能值得研究。
  • 看看你的previous questions,他们似乎都在“改进循环”。我认为您以错误的方式处理此问题。我认为您最好详细说明您的总体目标是什么,以及您正在使用的数据示例。
  • @SymbolixAU - 是的。我一次取两列,然后在上面做lm()。这为我想要捕获的每一行(每列的两个数据点)提供了$residuals。然后,我对数据集中每个可能的列组合重复此操作。
  • 问题可能是因为函数内的循环导致瓶颈。因此,即使您使用 apply,它仍然会循环。为什么不列出所有可能的列(变量)组合,然后在应用构造中使用该列表(可能是 sapply 或 lapply)。
  • @ChetanArvindPatil 一切都好。它实际上与 Parfait 答案具有相同的逻辑——这基本上摆脱了循环。此外,您可能还想考虑使用 microsoft R。我发现它更快,尤其是在进行贝叶斯采样时。

标签: r performance optimization functional-programming


【解决方案1】:

考虑expand.grid 的列名,然后使用mapply apply 系列的多输入版本,您可以在其中传递两个以上的向量/列表并在每个输入元素上运行一个函数。使用这种方法,您可以避免在循环中扩展向量并运行内部 while 循环:

数据

Data <- read.table(text="  data1       data2       data3      data4
-0.710003   -0.714271   -0.709946   -0.713645
-0.710458   -0.715011   -0.710117   -0.714157
-0.71071    -0.714048   -0.710235   -0.713515
-0.710255   -0.713991   -0.709722   -0.71397
-0.710585   -0.714491   -0.710223   -0.713885
-0.710414   -0.714092   -0.710166   -0.71434
-0.711255   -0.714116   -0.70945    -0.714173
-0.71097    -0.714059   -0.70928    -0.714059
-0.710343   -0.714576   -0.709338   -0.713644", header=TRUE)

流程

# Data frame of all combinations excluding same columns 
modelcols <- subset(expand.grid(c1=names(Data), c2=names(Data), 
                    stringsAsFactors = FALSE), c1!=c2)

# Function
analysisFunc <- function(x,y) {        
      # Fetch the two columns on which to perform analysis
      c1 <- Data[[x]]
      c2 <- Data[[y]]

      # Create linear model
      linearModel <- lm(c1 ~ c2)

      # Capture model data from summary
      modelData <- summary(linearModel)

      # Residuals
      residualData <- modelData$residuals
}

# Apply function to return matrix of residuals
linearData <- mapply(analysisFunc, modelcols$c1, modelcols$c2)
# re-naming matrix columns
colnames(linearData) <- paste(modelcols$c1, modelcols$c2, sep="_")

输出

    data2_data1   data3_data1   data4_data1   data1_data2   data3_data2   data4_data2
1  1.440828e-04  8.629813e-05  1.514109e-04  5.583917e-04 -0.0001205821  2.866488e-04
2 -6.949384e-04 -2.508770e-04 -2.487813e-04 -1.005367e-04 -0.0001263202 -2.145225e-04
3  2.132192e-04 -4.609125e-04  4.551430e-04 -8.715424e-05 -0.0004593840  4.133856e-04
4  3.692403e-04  2.182627e-04 -1.116648e-04  3.835538e-04  0.0000408864 -4.244855e-05
5 -2.025772e-04 -4.032600e-04  5.442655e-05 -8.423568e-05 -0.0003484501  4.986815e-05
6  2.336373e-04 -2.838073e-04 -4.425935e-04  1.967203e-04 -0.0003805576 -4.109706e-04
7  2.661145e-05  1.250425e-04 -6.893342e-05 -6.508936e-04  0.0003408023 -2.436194e-04
8  1.456357e-04  3.991303e-04 -2.496687e-05 -3.501856e-04  0.0004980726 -1.304535e-04
9 -2.349110e-04  5.701233e-04  2.359596e-04  1.343401e-04  0.0005555326  2.921120e-04
    data1_data3   data2_data3   data4_data3   data1_data4   data2_data4   data3_data4
1  5.121547e-04  4.313395e-05  2.829814e-04  4.232081e-04  1.795365e-05 -9.584175e-05
2 -1.649379e-06 -6.684696e-04 -2.349827e-04  1.975728e-04 -7.112598e-04 -3.014160e-04
3 -2.942277e-04  3.141257e-04  4.029018e-04 -3.420290e-04  2.382149e-04 -3.760631e-04
4  3.371847e-04  2.859362e-04 -3.420612e-05  3.168009e-04  3.048006e-04  1.062117e-04
5 -1.651011e-04 -1.308671e-04  3.332034e-05 -5.127719e-05 -1.969902e-04 -3.890484e-04
6  2.550032e-05  2.586674e-04 -4.196917e-04  3.235528e-04  2.115955e-04 -3.627735e-04
7 -5.692790e-04  1.157675e-04 -2.277195e-04 -5.922595e-04  1.840773e-04  3.645036e-04
8 -2.258187e-04  1.445371e-04 -1.077903e-04 -3.583290e-04  2.386756e-04  5.422018e-04
9  3.812360e-04 -3.628313e-04  3.051868e-04  8.276013e-05 -2.870674e-04  5.122258e-04

【讨论】:

  • 谢谢@Parfait。您的解决方案很优雅。我尝试使用更大的 6000x100 数据集。我得到warnings()In summary.lm(linearModel) : essentially perfect fit: summary may be unreliable,你怎么看?真实数据集为6000x400。
  • @ChetanArvindPatil 如果它解决了您提出的问题,您应该在 Parfait 的答案附近打勾。您当前的问题与您拥有的数据有关。
  • @ChetanArvindPatil - 你subset 的列名是否与expand.grid 之后的列名相同?如果不是,您正试图回归一个变量本身,这是完美的共线性,因此是警告。另一个原因是某些列配对并不完全相同,而是线性相关,可能是通过某些公式。检查数据源并根据需要排除。
  • 您使用的是 32 位还是 64 位机器?无论可用性如何,前者都限制为 3GB。对于后者,尝试增加内存:memory.limit(size=56000)。尝试关闭其他应用。并尝试在 RStudio 上使用命令行版本 Rscript,其代码将矩阵作为 .RData 和saveRDS() 输出到磁盘。然后,您可以通过 readRDS() 在其他后续脚本中使用数据。
  • @Parfait - 我在 64 位机器上,使用 RStudio。您对memory.limit(size=56000) 的建议得到了解决。谢谢。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2020-05-24
  • 1970-01-01
  • 2012-07-02
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多