【问题标题】:How to conditionally combine data.frame object in the list in more elegant way?如何以更优雅的方式有条件地组合列表中的 data.frame 对象?
【发布时间】:2016-11-10 12:02:54
【问题描述】:

我在列表中有 data.frame,我打算有条件地合并特定的 data.frame 对象,其中合并第二个、第三个 data.frame 对象而不重复,然后将它与第一个 data.frame 对象合并。但是,我使用 rbind 函数来完成这项任务,但我的方法并不优雅。任何人都可以帮助我改进解决方案吗?如何获得可用于动态函数式编程的更兼容的解决方案?我怎样才能得到想要的输出?任何想法 ?

可重现的例子:

dfList <- list(
  DF.1 = data.frame(red=c(1,2,3), blue=c(NA,1,2), green=c(1,1,2)),
  DF.2 = data.frame(red=c(2,3,NA), blue=c(1,2,3), green=c(1,2,4)),
  DF.3 = data.frame(red=c(2,3,NA,NA), blue=c(1,2,NA,3), green=c(1,2,3,4))
)

虚拟的方法:

rbind(dfList[[1L]], unique(rbind(dfList[[2L]], dfList[[3L]])))

显然,我在函数式编程中的尝试并不优雅。怎样才能优雅地做到这一点?

想要的输出:

red blue green
1    1   NA     1
2    2    1     1
3    3    2     2
11   2    1     1
21   3    2     2
31  NA    3     4
6   NA   NA     3

如何更优雅、更高效地改进我的解决方案?提前致谢

【问题讨论】:

  • "merge" 不是 rbind 的同义词。
  • @ChirayuChamoli 这与我在线程中所做的几乎相同,我需要动态解决方案。有什么想法吗?
  • 我现在明白了。让我看看。

标签: r dataframe


【解决方案1】:

执行此操作的最佳(最简单和最快的方法)是data.table::rbindlist

它会像这样工作:

library(data.table)
dfList <- list(
  DF.1 = data.table(red=c(1,2,3), blue=c(NA,1,2), green=c(1,1,2)),
  DF.2 = data.table(red=c(2,3,NA), blue=c(1,2,3), green=c(1,2,4)),
  DF.3 = data.table(red=c(2,3,NA,NA), blue=c(1,2,NA,3), green=c(1,2,3,4))
)

# part 1: list element 1
dt_1 <- dfList[[1]]

# part 2: all other list elements (in your case 2 and 3)
dt_2 <- unique(rbindlist(dfList[-1]))

# use rbindlist to bind the rows together
dt_all <- rbindlist(list(dt_1, dt_2))

评论。

我的解决方案与您提出的解决方案非常接近。我认为这种方式的“丑陋”在于合并数据集并分离第一个元素(并以不同的方式处理它)是一种极端情况。最好的解决方案可能是退后一步,考虑潜在的想法,并使用数据集中的一个附加变量来解决它(即,对于 df1,然后对于 df2_3),我会考虑 R 方式。

这个想法看起来像这样:

myList2 <- list(
  DF.1 = data.table(red=c(1,2,3), blue=c(NA,1,2), green=c(1,1,2), var = "df1"),
  DF.2 = data.table(red=c(2,3,NA), blue=c(1,2,3), green=c(1,2,4), var = "other"),
  DF.3 = data.table(red=c(2,3,NA,NA), blue=c(1,2,NA,3), green=c(1,2,3,4), var = "other")
)

dt <- rbindlist(myList2)
unique(dt)
# red blue green   var
# 1:   1   NA     1   df1
# 2:   2    1     1   df1
# 3:   3    2     2   df1
# 4:   2    1     1 other
# 5:   3    2     2 other
# 6:  NA    3     4 other
# 7:  NA   NA     3 other

【讨论】:

  • 感谢您的评论!我编辑了帖子,这对您有更多帮助吗?
  • 仍然不相信自己将 myList 转换为 data.table,然后继续 data.table 解决方案。为什么不能使用原始列表来做到这一点?显然我的解决方案可以做到,但它并不漂亮。
【解决方案2】:

rbinding 一个只有基数 R 的 data.frames 列表的方法是do.call(list, rbind)(参见this question,它也提供了一些替代方案)。

如果您只需要唯一的行,您可以使用 unique 跟进

 unique(do.call(dfList, rbind))

【讨论】:

  • 这里的条件是首先我需要将第二个、第三个 data.frame 合并在一起而不重复,然后我将此结果与不删除重复行的第一个 data.frame 合并。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多