【发布时间】:2017-04-15 14:42:16
【问题描述】:
我正在尝试查看基因序列中的某些核苷酸模式。我刚刚完成了read.table 来获取它,但我也尝试将它转换为向量和数据帧。
我如何搜索一个模式(例如AACG)甚至只是一个核苷酸字符?我已经尝试过grep 和%in%,但它们返回的是空结果。这可能是我忽略的相对简单的事情。
这就是我将数据输入程序的方式。这是一个巨大的文件; 20,347 个字母,全部为 ACTG。
data <- read.table(MTHFR.txt)
我一直在尝试以这种方式将其放入字符向量中;
data.cv <- as.character(data)
但这会创建一个似乎是行号的列表,而不是核苷酸序列。
数据在online here可用。截至目前,这是数据的负责人:
head(data)
V1
1 ATGACGATAAAGGCACGGCCTCCAACGAGACCTGTGGGCACGGCCATGTTGGGGGCGGGGCTTCCGGTCA
2 CCCGCGCCGGTGGTTTCCGCCCTGTAGGCCCGCCTCTCCAGCAACCTGACACCTGCGCCGCGCCCCTTCA
3 CTGCGTTCCCCGCCCCTGCAGCGGCCACAGTGGTGCGGCCGGCGGCCGAGCGTTCTGAGTCACCCGGGAC
4 TGGAGGGTGAGTGACGGCGAGGCCGGGGTCGCCGGGAGGGAGATCCTGGAGCCGGCAAACAACCTCCCGG
5 GGGCAAGGACGTGCTTGTGGGCGGGGAGCGCTGGAGGCCGGCCTGCCTCTCTTCTTGGGGGGGGCTGCCG
6 CCTCCCTTGCGCACCCTTCGCGGGATTAGTGTAACTCCCAATGGCTACCACTTCCAGCGACCGCCAACCC
【问题讨论】:
-
你不能做
as.character(data)- 你需要做as.character(data$variable) -
预期输出是什么?
-
你下载数据的时候选择了什么格式?我在您提到的页面上看到了很多选择。到目前为止,我可以比较我对 R 的有限经验和我对 python 的长期经验,我认为我宁愿使用 python(可能使用 biopython)而不是 R 来读取序列并在其中搜索模式。
标签: r regex vector character bioinformatics