【问题标题】:R function to filter / subset (programatically) multiple values over one variable [duplicate]R函数过滤/子集(以编程方式)一个变量上的多个值[重复]
【发布时间】:2015-08-29 20:24:41
【问题描述】:

是否有一个函数可以接受一个数据集、一个列、一个运算符,但需要几个值来评估一个条件?

v1 <- c(1:3)
v2 <- c("a", "b", "c")
df <- data.frame(v1, v2)

子集的选项(以编程方式)

result <- df[df$v2 == "a" | df$v2 == "b", ]
result
1  1  a
2  2  b

或者,为了更稳健

result1 <- df[ df[[2]] == "a" | df[[2]] == "b", ]
result1
  v1 v2
1  1  a
2  2  b

或者,为了更简单的语法:

library(dplyr)
result2 <- filter(df, v2 == "a" | v2 == "b")
result2
  v1 v2
1  1  a
2  2  b

(假设我可以在函数中安全地使用 dplyr 的 filter() 是否正确? )

我没有在上面包含子集(),因为它已知仅用于交互使用。

在上述所有情况下,都必须重复条件 (v2 == "a" | v2 == "b")。

我正在寻找一个可以将向量传递给参数的函数,例如 c("a", "b"),因为我想传递大量值并自动执行该过程。

这样的功能可能是这样的:

fun(df, col = v2, operator = "|", value = c("a", "b")

谢谢

【问题讨论】:

    标签: r subset


    【解决方案1】:

    如果要检查的元素数量大于 1,我们可以使用%in%

    df[df$v2 %in% c('a', 'b'),]
    #   v1 v2
    #1  1  a
    #2  2  b
    

    或者如果我们使用subsetdf$ 可以被删除

    subset(df, v2 %in% c('a', 'b'))
    

    或者dplyr::filter

    filter(df, v2 %in% c('a', 'b'))
    

    这可以包装在一个函数中

    f1 <- function(dat, col, val){
     filter(dat, col %in%  val)
     }
    
    f1(df, v2, c('a', 'b'))
    #  v1 v2
    #1  1  a
    #2  2  b
    

    如果我们需要使用==,我们可以循环vector以在list中进行比较,并将Reduce|一起使用

    df[Reduce(`|`, lapply(letters[1:2], `==`, df$v2)),]
    

    【讨论】:

    • 谢谢。它确实解决了这个问题,因为它需要 1 个或多个元素。不是 %in%, !%in% 的反义词吗?我想我以前用过。知道为什么它会在函数内抛出错误吗?谢谢
    • @jpinelo 你可能要试试filter(df, !v2 %in% c('a', 'b'))
    猜你喜欢
    • 2020-02-15
    • 1970-01-01
    • 2016-03-29
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多