【发布时间】:2013-08-02 19:06:49
【问题描述】:
我有 2 个文件,一个是 fasta 文件,另一个是 fastq 文件。我想获取fasta,读取每一行并在fastq 文件中搜索每一行并打印顶行和底行。这就是我所拥有的
fasta 文件
读取1
啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊
AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAC
AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAG
AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAGA
AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAGG
for seq in `cat sequences`;do grep -A 2 -B 1 $seq FAP.1.txt;done
@DH1DQQN1:269:C1UKCACXX:1:1107:20386:6577 1:N:0:TTAGGC
AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAC
+
CCCFFFFFHGHHHJIJHFDDDB173@8815BDDB###############
@DH1DQQN1:269:C1UKCACXX:1:1114:5718:53821 1:N:0:TTAGGC
啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊
+ ;@?DBD
@DH1DQQN1:269:C1UKCACXX:1:1209:10703:35361 1:N:0:TTAGGC
啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊
+
@@@FFFFFHGHHHGIJHFDDDDDBDD69@6B-707537BDDDB75@@85
@DH1DQQN1:269:C1UKCACXX:1:1210:18926:75163 1:N:0:TTAGGC
AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAG
@CCFFFFFHHHHHJJJHFDDD@77BDDDDB077007@B###########
从这里我们可以看到AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAA出现了两次,但我只想打印一次。我该怎么做?
最终输出文件
@DH1DQQN1:269:C1UKCACXX:1:1107:20386:6577 1:N:0:TTAGGC
AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAC
+
CCCFFFFFHGHHHJIJHFDDDB173@8815BDDB###############
@DH1DQQN1:269:C1UKCACXX:1:1114:5718:53821 1:N:0:TTAGGC
啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊啊
+
;@?DBD
@DH1DQQN1:269:C1UKCACXX:1:1210:18926:75163 1:N:0:TTAGGC
AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAG
+
@CCFFFFFHHHHHJJJHFDDD@77BDDDDB077007@B
【问题讨论】:
-
生物学家你怎么了.. 总是发布格式最差的问题!您需要阅读 stackoverflow.com/help/formatting 以了解格式在 Stackoverflow 上的工作原理,以及在提问时阅读 stackoverflow.com/help/asking。
-
对不起!下次不会那样了
-
在过去的几个月里,您问了 14 个问题,所有问题的格式都很糟糕,必须彻底检修(似乎大部分是我自己做的)。如果您希望社区能够帮助您,那么您至少可以正确地格式化您的问题。
标签: python unix awk grep fastq