【发布时间】:2016-04-18 23:19:51
【问题描述】:
我有一个包含这些信息的非常大的文件
7-92383888 rs10
7-6013153 rs10000
12-126890980 rs1000000
4-57561647 rs10000003
4-85161558 rs10000005
4-172776204 rs10000008
4-71048953 rs10000009
2-50711642 rs1000001
第一列是染色体编号和碱基对位置,第二列是可以在该特定区域找到的 SNP。在第一列中有一些重复项,但在第二列中没有。如何对第 1 列进行排序,查找重复项,然后删除整行?因此,删除第 1 列的重复项,同时删除第 2 列中的匹配值。另外,在排序时,我不希望第 1 列和第 2 列之间的匹配发生变化。
我阅读了以前的帖子,我知道我必须使用 sort 和 uniq 命令,但我不知道如何。
谢谢。
【问题讨论】:
标签: unix