【问题标题】:recoding and collapasing multiple binary-coded columns重新编码和折叠多个二进制编码的列
【发布时间】:2021-11-09 04:22:50
【问题描述】:

正在努力寻找一个优雅的解决方案...

我对“请选择所有适用的”问题做出了回应,其中每个问题的选项 A 到 F 都被编码为二进制变量。因此,例如,下面假数据集中的第一响应者只为问题 1 打勾 D,然后为问题 2 打勾 A、C、D 和 E。

library(dplyr)

cols <- paste0('foo', '_', c(1:2, '3a', '3b')) %>%
  lapply(\(i) paste0(i, '_', LETTERS[1:6])) %>%
  unlist()

set.seed(1)
df <- lapply(cols, \(i) i = sample(0:1, 5, replace = TRUE)) %>%
  setNames(cols) %>%
  data.frame()

'data.frame':   5 obs. of  24 variables:
 $ foo_1_A : int  0 1 0 0 1
 $ foo_1_B : int  0 0 0 1 1
 $ foo_1_C : int  0 0 0 0 0
 $ foo_1_D : int  1 1 1 1 0
 $ foo_1_E : int  0 0 0 0 0
 $ foo_1_F : int  0 1 0 0 1
 $ foo_2_A : int  1 1 0 1 0
 $ foo_2_B : int  0 1 0 1 1
 $ foo_2_C : int  1 1 0 1 1
 $ foo_2_D : int  1 1 1 0 0
 $ foo_2_E : int  1 0 1 1 0
 $ foo_2_F : int  0 1 1 1 0
 $ foo_3a_A: int  0 1 1 1 1
 $ foo_3a_B: int  1 1 0 1 1
 $ foo_3a_C: int  1 1 0 0 0
 $ foo_3a_D: int  1 1 0 0 1
 $ foo_3a_E: int  1 1 0 0 0
 $ foo_3a_F: int  1 0 1 0 1
 $ foo_3b_A: int  0 0 1 1 0
 $ foo_3b_B: int  0 0 1 1 0
 $ foo_3b_C: int  1 1 1 0 0
 $ foo_3b_D: int  0 0 1 0 0
 $ foo_3b_E: int  0 0 0 1 1
 $ foo_3b_F: int  1 1 0 1 1

我想要将1 重新编码为每列的选择字母(ABCDEF)并将选择连接为每个问题,以便我有这样的事情:

foo_1  D     ADF   D     BD    ABF
foo_2  ACDE  ABCDF DEF   ABCEF BC
foo_3a BCDEF ABCDE AF    AB    ABDF
foo_3b CF    CF    ABCD  ABEF  EF

这是我在意识到我会一遍又一遍地重复类似代码之前得到的:

df <- df %>% mutate(across(
  starts_with('foo') & ends_with('A'),
  ~ recode(., `1` = 'A', .default = NA_character_)
))

【问题讨论】:

  • 对于重新编码步骤,我会使用这个:df %&gt;% mutate(across(everything(), ~ifelse(.x==1, str_extract(deparse(substitute(.x)), "[A-Z]$"), NA)))。不太清楚如何从那里去

标签: r multiple-columns dplyr


【解决方案1】:

另一种选择是将dplyr::rowwisedplyover::over 一起使用(免责声明:我是{dplyover} 的维护者)。 dplyover::cut_names 允许我们选择我们需要的列名的字符串部分。然后我们可以在across 中使用它来获取df 的那些部分,然后我们需要获取names 并使用行数据as.logical 对它们进行子集化。最后,我们需要替换名称,以便只保留最后一个字母。

library(tidyverse)
library(dplyover) # https://github.com/TimTeaFan/dplyover

df %>% rowwise %>% 
  summarise(over(cut_names("_\\w$"), ~ 
    unlist(across(starts_with(.x))) %>% 
    {names(.)[as.logical(.)]} %>%  
    {paste(gsub(paste0(.x, "_"), "", .), collapse = "")}
  )) 

#> # A tibble: 5 x 4
#>   foo_1 foo_2 foo_3a foo_3b
#>   <chr> <chr> <chr>  <chr> 
#> 1 D     ACDE  BCDEF  CF    
#> 2 ADF   ABCDF ABCDE  CF    
#> 3 D     DEF   AF     ABCD  
#> 4 BD    ABCEF AB     ABEF  
#> 5 ABF   BC    ABDF   EF

reprex package (v2.0.1) 于 2021-09-14 创建

【讨论】:

  • 感谢您提供此替代解决方案。我的项目中已经有tidyverse,所以我决定使用上述解决方案之一。
【解决方案2】:

一种选择是使用pivot_longer 重塑为长格式,然后通过将之前生成的序列列分组到summarise across 'foo' 列,方法是将其从二进制转换为逻辑,子集'grp ' 列和paste(str_c) 他们在一起

library(dplyr)
library(tidyr)
library(stringr)
df %>%
    mutate(rn = row_number()) %>%
    pivot_longer(cols = -rn, names_to = c(".value", "grp"), 
          names_pattern = "^(.*_.*)_(.*)") %>% 
    group_by(rn) %>%
    summarise(across(-grp, ~ str_c(grp[as.logical(.)], 
          collapse="")), .groups = 'drop') %>% 
    select(-rn)

-输出

# A tibble: 5 x 4
  foo_1 foo_2 foo_3a foo_3b
  <chr> <chr> <chr>  <chr> 
1 D     ACDE  BCDEF  CF    
2 ADF   ABCDF ABCDE  CF    
3 D     DEF   AF     ABCD  
4 BD    ABCEF AB     ABEF  
5 ABF   BC    ABDF   EF 

或者另一种选择是

library(purrr)
df %>% 
   summarise(across(everything(), ~case_when(as.logical(.) ~ 
        rep(str_remove(cur_column(), ".*_.*_"), n())))) %>% 
   split.default(str_remove(names(.), "_[^_]+$")) %>%
   map_dfc(~ .x %>%
        unite(new, everything(), na.rm = TRUE, sep="") %>% 
        pull(new)) 
# A tibble: 5 x 4
  foo_1 foo_2 foo_3a foo_3b
  <chr> <chr> <chr>  <chr> 
1 D     ACDE  BCDEF  CF    
2 ADF   ABCDF ABCDE  CF    
3 D     DEF   AF     ABCD  
4 BD    ABCEF AB     ABEF  
5 ABF   BC    ABDF   EF    

或使用base R

sapply(split.default(df, sub("(.*_.*)_.*", "\\1", names(df))), 
    function(x) apply(x, 1, FUN= function(y) paste(sub(".*_", "", 
     names(y))[as.logical(y)], collapse="")))
    foo_1 foo_2   foo_3a  foo_3b
[1,] "D"   "ACDE"  "BCDEF" "CF"  
[2,] "ADF" "ABCDF" "ABCDE" "CF"  
[3,] "D"   "DEF"   "AF"    "ABCD"
[4,] "BD"  "ABCEF" "AB"    "ABEF"
[5,] "ABF" "BC"    "ABDF"  "EF"  

【讨论】:

  • 谢谢!您的 3 个解决方案中的第一个对我来说很有意义。除了,我唯一不太明白的是across.groups = 'drop' 部分——这是在做什么?
  • @jatx50 与summarise drop groups 属性有关。在here中有详细提及
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2015-12-23
  • 2011-05-08
  • 1970-01-01
  • 1970-01-01
  • 2018-05-11
  • 1970-01-01
  • 2014-08-09
相关资源
最近更新 更多