【问题标题】:Replace consecutive repeat values based on different run lengths in R根据R中不同的运行长度替换连续的重复值
【发布时间】:2020-11-10 22:24:14
【问题描述】:

考虑以下数据集:

dat<-data.frame(id = c(1,1,1,1,1,1,1,2,2,2,2,2,2,2,2,3,3,3,3,3,3,3,3),
                var1 = c("A","NA","B","A","NA","NA","B","A","NA","NA","NA","C","A","NA","B","A","NA","NA","D","A","NA","NA","B"))

dat

首先,我需要用 NA 两侧的值填写所有 NA,这在 dplyr 中是成功的:

mutate(value = ifelse(is.na(value), paste0(na.locf(value), "-", na.locf(value, fromLast=TRUE)), 
                        value))

这导致:

   id var1
1   1    A
2   1  A-B
3   1    B
4   1    A
5   1  A-B
6   1  A-B
7   1    B
8   2    A
9   2  A-C
10  2  A-C
11  2  A-C
12  2    C
13  2    A
14  2  A-B
15  2    B
16  3    A
17  3  A-D
18  3  A-D
19  3    D
20  3    A
21  3  A-B
22  3  A-B
23  3    B

但是,我现在需要根据重复的连续运行长度(按 id col 分组)保留一些值,同时将其他值返回 NA。如果 A-B 连续重复长于 1 则返回所有值到 NA,如果 A-C 连续重复长于 2 则返回所有值到 NA,如果 A-D 连续重复长于 3 则返回所有值到北美。

我想要的结果是:

   id var1
1   1    A
2   1  A-B
3   1    B
4   1    A
5   1   NA
6   1   NA
7   1    B
8   2    A
9   2   NA
10  2   NA
11  2   NA
12  2    C
13  2    A
14  2  A-B
15  2    B
16  3    A
17  3  A-D
18  3  A-D
19  3    D
20  3    A
21  3   NA
22  3   NA
23  3    B

我认为这可以通过group_by(id)rle() 或 data.table 的rleid() 的组合来实现,然后根据值和运行长度有条件地将值转回 NA 与 case_when(我考虑过ifelse() 但我的条件比示例中提供的要多得多,并且已经阅读了 case_when 会是更好的选择),但我无法弄清楚如何编写精确的代码来执行此操作。我遇到的一个类似问题是Replace NA with previous value with limit,但它是我需要做的更简单的版本。

任何建议将不胜感激。我觉得我很接近了,但我需要帮助才能达到预期的结果。

【问题讨论】:

  • 代码中的“值”列是什么

标签: r group-by dplyr rle


【解决方案1】:

你可以做什么:

myfun <- function(x){
  y <- rle(x)
  z <- match(y$values, LETTERS)
  ind <- which(is.na(z))
  m <- z[ind + 1] - z[ind - 1] >= y$lengths[ind]
  y$values[ind[m]] <- paste(y$values[ind[m] - 1], y$values[ind[m] + 1], sep = "-")
  inverse.rle(y)
}


transform(dat, var1 = ave(var1, id, FUN = myfun))

   id var1
1   1    A
2   1  A-B
3   1    B
4   1    A
5   1   NA
6   1   NA
7   1    B
8   2    A
9   2   NA
10  2   NA
11  2   NA
12  2    C
13  2    A
14  2  A-B
15  2    B
16  3    A
17  3  A-D
18  3  A-D
19  3    D
20  3    A
21  3   NA
22  3   NA
23  3    B

【讨论】:

  • 对不起,如果这是我的问题,但代码返回错误“rle(x) 中的错误:'x' 必须是原子类型的向量”,有什么想法吗?跨度>
  • @el88 确保将原子向量传递给函数。不要传递列表、数据框等
  • 谢谢@Onyambu。我也是为了解决这个错误。由于我是创建函数的新手,您介意解释一下您为 m 所做的计算吗? IE。 z[ind + 1] - z[ind - 1] >= y$lengths[ind]
  • @Onyambu 我认为如果您发布与您的功能相关的解释会很有帮助 - 我对m 行也有点好奇。我是否正确理解它本质上是“如果两个字母之间的差异大于NA 的运行长度,请插入字母对”?为什么只针对那些对?提前谢谢。
  • @el88 该行指出,如果两个字母之间的差异,例如 D-A (4-1) = 3 大于它们之间的 NA,那么这是有效的 NA,可以替换为范围 A-D。
【解决方案2】:

首先,我强烈推荐使用replace_na函数。

那么你可以像这样使用smth:

x <- data.frame(matrix(c(1, 1, 1, 2, 2, 2, 3, 3, 3,
                         0, 1, 2, 3, 4, 4, 5, 5, 5), ncol=2))
x %>%
    group_by(X1) %>%
    mutate(X3 = ifelse(X2 == lag(X2, default = "") | X2 == lead(X2, default = ""),
                       X2, NA_integer_)) %>%
    group_by(X1, X3) %>%
    mutate(X4 = n())

输入:

  X1 X2
1  1  0
2  1  1
3  1  2
4  2  3
5  2  4
6  2  4
7  3  5
8  3  5
9  3  5

输出:

# A tibble: 9 x 4
# Groups:   X1, X3 [4]
     X1    X2    X3    X4
  <dbl> <dbl> <dbl> <int>
1     1     0    NA     3
2     1     1    NA     3
3     1     2    NA     3
4     2     3    NA     1
5     2     4     4     2
6     2     4     4     2
7     3     5     5     3
8     3     5     5     3
9     3     5     5     3

然后你可以使用 X4 制作你想要的东西

【讨论】:

    猜你喜欢
    • 2020-09-09
    • 2019-11-06
    • 2020-11-07
    • 2021-05-08
    • 2022-12-17
    • 2019-01-02
    • 1970-01-01
    • 2018-04-22
    • 1970-01-01
    相关资源
    最近更新 更多