【发布时间】:2018-11-05 03:39:29
【问题描述】:
我下载了 276 个核苷酸长度的 876 个 DNA 序列,并用这些信息制作了一个 df。
TOTAL <- read.csv("TOTAL.csv")
TOTAL
Ind Seq Tipo
1 AACTTTCAACAACGGATCTCTTGGTTC... _NA_
2 AACTTTTAAAAACGGGTTCTTTGGTTC... _NA_
3 AACTTTCAACAACGGATCTCTTGGTTC... _NA_
4 AACTTTCAACAACGGATCTCTTGGTTC... _NA_
52 AACTTTCAACAACGGATCTCTTGGGTC... _NA_
821 AACTTTCAACAACGGATTTTTTGGTTC... _NA_
876 AACTTTCAACAACGGATCTCTTGGTTN... _NA_
然后我提取了唯一序列,发现有 53 种不同类型的序列。最后我为每个唯一序列分配了一个从"A"到"BA".
UNIQUE <- read.csv("UNIQUE.csv")
UNIQUE
Ind Seq Tipo
1 AACTTTCAACAACGGATCTCTTGGTTC... A
2 AACTTTTAAAAACGGGTTCTTTGGTTC... B
3 AACTTTCAACAACGGATCTCTTGGTTC... C
10 AACTTTCAACAACGGATCTCTTGGGTC... J
30 AACTTTCAACAACGGATTTTTTGGTTC... AD
53 AACTTTCAACAACGGATCTCTTGGTTN... BA的字符值
我想要的是,为TOTAL$Seq 中的每个值在UNIQUE$Seq 中找到匹配项。然后将UNIQUE$Haplo 中对应于与UNIQUE$Seq 匹配的值分配给TOTAL$Haplo。我怎样才能做到这一点?
TOTAL
Ind Seq Tipo
1 AACTTTCAACAACGGATCTCTTGGTTC... A
2 AACTTTTAAAAACGGGTTCTTTGGTTC... B
3 AACTTTCAACAACGGATCTCTTGGTTC... C
4 AACTTTCAACAACGGATCTCTTGGTTC... C
52 AACTTTCAACAACGGATCTCTTGGGTC... J
821 AACTTTCAACAACGGATTTTTTGGTTC... AD
876 AACTTTCAACAACGGATCTCTTGGTTN... BA
【问题讨论】:
-
试试
match肯定会奏效的。