【发布时间】:2021-07-21 12:37:06
【问题描述】:
抱歉,我仍然熟悉 dplyr 和 data.table 的世界,并试图弄清楚它的全部功能!
我有一个数据集,我有兴趣在其中对特定变量(轨迹)进行分组:
DF <- structure(list(Gene = c("GeneA", "GeneB", "GeneC", "GeneD", "GeneE"),
Locus = c("1","2","2","3","3"),
Chromosome = c("1","1","1","1","1"),
Start = c("100","500","600","1000","1500"),
Stop = c("200","550","700","1400","1750")),
.Names = c("Gene","Locus","Chromosome","Start","Stop"),
row.names = c(NA, 5L),
class = "data.frame")
> DF
Gene Locus Chromosome Start Stop
GeneA 1 1 100 200
GeneB 2 1 500 550
GeneC 2 1 600 700
GeneD 3 1 1000 1400
GeneE 3 1 1500 1750
我想知道在基因座列有多个值的情况下,是否可以写出包含来自 Gene、Chromosome、Start、Stop 列的值的“每个基因座”文件。所以 Locus==1 不会写出任何文本文件,但是 Locus==2 和 Locus==3 的 Gene 列中的值将被写入单个文件? 例如
<loc2.txt>
Gene Chromosome Start Stop
GeneB 1 500 550
GeneC 1 600 700
<loc3.txt>
Gene Chromosome Start Stop
GeneD 1 1000 1400
GeneE 1 1500 1750
提前感谢您的帮助!
【问题讨论】:
-
您的
structure最后似乎缺少一个括号,并且似乎与您的示例输出不匹配。您能否编辑您的问题或澄清这一点? -
补充上述内容 - 您可能有一个轻微的错字 - 在
DF中,GeneC 的对应基因座是 3(第 3 行),但在 DF2 中它是 2。该值应该是是 2 还是 3? -
已修复!抱歉,这是我在问题创建页面和 R 终端之间调整数据的结果!
标签: r dplyr data.table data-management