【问题标题】:Calculating weightedMedian (matrixStats) coloumnwise by category按类别按列计算 weightedMedian (matrixStats)
【发布时间】:2016-10-27 03:44:17
【问题描述】:

假设我有两个数据框“值”和“权重”,我想按类别(A、B、C)计算加权中位数(year1、year2):

values <- data.frame(TICKER=c("A","A","B","B","B","C","C","C","C"), year1=c(1,2,3,4,5,6,7,8,9), year2=c(9,8,7,6,5,4,3,2,1))
weights <- data.frame(TICKER=c("A","A","B","B","B","C","C","C","C"), year1=c(0.3,0.7,0.25,0.25,0.5,0.1,0.1,0.6,0.2), year2=c(0.6,0.4,0.3,0.5,0.2,0.4,0.2,0.1,0.3))

为此,我想使用 ddply 和 weightedMedian 函数(包 matrixStats)。

output <- ddply(values, .(TICKER), colwise(weightedMedian(values, weights), na.rm=TRUE))

但是,我收到错误消息:

"(list) object cannot be coerced to type 'double'"

有人知道如何调整代码以获得可行的解决方案吗?

我尝试将数据帧转换为矩阵(通过 as.matrix),因为 weightedMedian 需要一个矩阵作为输入。但是,这无济于事。 到目前为止我发现的唯一解决方案是使用子集的循环(但是,这非常慢而且不是很优雅)

output <- matrix(data=0, nrow=3, ncol=2)
for (i in 2:ncol(values)){
 for (j in 1:length(unique(values$TICKER))){
  values.j <- subset(values, values$TICKER == as.character(unique(values$TICKER)[j]))
  weights.j <-  subset(weights, weights$TICKER == as.character(unique(values$TICKER)[j]))
  output[j,(i-1)] <- weightedMedian(values.j[,i], weights.j[,i], na.rm=TRUE)
}}

任何帮助将不胜感激。非常感谢。

【问题讨论】:

  • 嗨 - 不,真实数据包含约。 70 个周期(列)和大约 ca。 15,000 个类别

标签: r dataframe plyr median


【解决方案1】:

除了OP提到的weightedMedian函数外,Hmisc包还提供了一个更通用的wtd.quantile函数。

我将两个 data.frames 拆分为列表,并将这些函数应用于嵌套 sapplys 的两个年份变量。比较下面的结果,weightedMedian 似乎产生了预期的结果。

要准备数据,请将值和权重沿其 TICKER 拆分为列表。

# split values and weights into lists by category
valuesList <- split(values, values$TICKER)
weightsList <- split(weights, values$TICKER)

如果我在上述代码中使用 OP 问题中的 weightedMedian,我会得到以下信息:

library(matrixStats)
sapply(names(valuesList),
  function(i) sapply(names(valuesList[[i]])[-1],
                function(j) weightedMedian(valuesList[[i]][[j]],
                                           w=weightsList[[i]][[j]])))

        A        B C
year1 1.7 4.333333 8
year2 8.6 6.125000 3

另一个包Hmisc 具有加权分位数函数wtd.quantile

# load Hmisc package
library(Hmisc)

sapply(names(valuesList),
   function(i) sapply(names(valuesList[[i]])[-1],
                   function(j) {
                     wtd.quantile(valuesList[[i]][[j]],
                                  weights=weightsList[[i]][[j]], probs=0.5)}))

返回

myMedians 
          A B C
year1.50% 2 5 9
year2.50% 9 7 4

通过检查,matrixStats 的结果似乎更合理。例如,TICKER==C,year==2 不应为 4。

【讨论】:

    【解决方案2】:

    如果您想留在 plyr/weightedStats 上下文中,我将首先结合 data.frames,然后使用您的值变量的已知列索引运行 ldplyddply

    df <- data.frame(values,wt=weights)
    
    output <- lapply(names(values)[-1], 
       function(i) ddply(df,.(TICKER), 
         function(x) setNames(weightedMedian(x=x[,i],w=x[,match(i,names(x))+ncol(x)/2]),i)))
    

    然后您可以执行以下操作以将结果放入单个 data.frame

    do.call('join',output)
    

    给你

      TICKER    year1 year2
    1      A 1.700000 8.600
    2      B 4.333333 6.125
    3      C 8.000000 3.000
    

    顺便说一句,您的错误消息的原因是您只在weightedMedian 中调用整个weights data.frame 时“切片”您的values data.frame。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-08-09
      • 2015-12-18
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-10-04
      • 1970-01-01
      • 2018-03-13
      相关资源
      最近更新 更多