【发布时间】:2018-12-11 19:39:09
【问题描述】:
我一直在尝试几种不同的方式(聚合、colSum、tally 等),但我很挣扎。
我有一个包含样本结果的大型数据集(100 列,1,000,000 行),其中我已将各个样本名称替换为它们所属类别的名称。 (我需要按类别统计每个数据点的总数。
Sequence position cat1 cat1 cat2 cat2 cat2 cat3 cat3
abfsgdfy a 0 1 0 1 0 1 1
abfsgdfy b 0 0 1 1 1 1 0
dgdtecgd b 1 1 1 0 0 0 0
我知道不希望有相同的列名,所以我一直在尝试转置数据,然后使用它。但这也没有让我走得太远。
我正在寻找的输出将是:
Sequence position cat1 cat2 cat3
abfsgdfy a 1 1 2
abfsgdfy b 0 3 1
dgdtecgd b 2 1 0
如果有帮助,我有一个表格可以将样本名称转换为更大的类别组:
Type Name
cat1 sample1
cat1 sample2
cat2 sample3
cat2 sample4
cat2 sample5
cat3 sample6
cat3 sample7
感谢您的帮助!
【问题讨论】: