【问题标题】:separating specific strings from HGVS format in R在 R 中将特定字符串与 HGVS 格式分开
【发布时间】:2018-11-29 01:24:35
【问题描述】:

我正在尝试将 ">" 符号之前和之后的特定字符串与 HGVS 短突变格式分开,示例如下:

"p.1258_1259EE>E"       "p.286_287RR>R"         "p.57_58KK>K"           "p.287_288AA>A"

我想要实现的是从第一个字符串“p.1258_1259EE>E”说,我可以得到以下内容:

starting_position    end_position    initial_aa    mutant_aa
1258                 1259            EE            E
286                  287             RR            R
57                   58              KK            K

似乎比我最初想象的要复杂一些。希望这里有人可以提供帮助。谢谢,童童

【问题讨论】:

标签: r mutation


【解决方案1】:

如果模式相同,base R 选项将使用sub 格式化字符串以引入通用sep 并在read.csv 中使用它

df1 <- read.csv(text= sub("^[^0-9]+([0-9]+)_([0-9]+)([A-Z]+)>([A-Z]+)", 
    "\\1,\\2,\\3,\\4", v1), header = FALSE, stringsAsFactors = FALSE, 
    col.names = c('starting_position', 'end_position', 'initial_aa', 'mutant_aa'))
df1
#   starting_position end_position initial_aa mutant_aa
#1              1258         1259         EE         E
#2               286          287         RR         R
#3                57           58         KK         K
#4               287          288         AA         A

数据

v1 <- c("p.1258_1259EE>E", "p.286_287RR>R", "p.57_58KK>K",  "p.287_288AA>A")

【讨论】:

  • 是的,这正是我要找的。谢谢!
猜你喜欢
  • 1970-01-01
  • 2017-04-26
  • 2018-08-24
  • 1970-01-01
  • 1970-01-01
  • 2019-10-03
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多