【发布时间】:2018-12-17 05:13:20
【问题描述】:
假设我有类似以下的文件。
文件 1
1,144931087,144931087,T,C
16,89017167,89017167,C,G
17,7330235,7330235,G,T
17,10222478,10222478,C,T
文件 2
1,144931087,144931087,T,C
16,89017167,89017167,C,G
17,10222478,10222478,C,T
文件 3
17,10222478,10222478,C,T
我想知道每个文件中有多少次重复值,所以理想情况下,输出应该是这样的:
输出
2 1,144931087,144931087,T,C
2 16,89017167,89017167,C,G
3 17,10222478,10222478,C,T
1 17,7330235,7330235,G,T
我使用以下命令计算重复值。
sort Test1.csv Test2.csv Test3.csv | uniq --count
现在我想为计数的输出添加文件名。 我想要的输出应该是这样的:
Test1 Test2 2 1,144931087,144931087,T,C
Test1 Test2 2 16,89017167,89017167,C,G
Test1 Test2 Test 3 3 17,10222478,10222478,C,T
Test1 1 17,7330235,7330235,G,T
谁能帮我获得所需的输出,或者谁能建议我更好的方法来获得所需的输出?
【问题讨论】:
标签: unix awk compare comparison string-comparison