【发布时间】:2014-11-02 09:37:15
【问题描述】:
我有一个文件,我正试图为一些下游分析做准备,但我需要两行中的字符数相同。该文件格式如下,其中第 2 行 (CTTATAATGCCGCTCCCTAAG) 和第 4 行 (bbbeeeeegggggiiiiiiiiigghiiiiiiiiiiiiiiiiiigeccccb) 需要包含相同数量的字符。
@HWI-ST:8:1101:3346:2198#GTCCGC/1
CTTATAATGCCGCTCCCTAAG
+HWI-ST:8:1101:3346:2198#GTCCGC/1
bbbeeeeegggggiiiiiiiiigghiiiiiiiiiiiiiiiiiigeccccb
@HWI-ST:8:1101:10491:2240#GTCCGC/1
GAGTAGGGAGTATACATCAG
+HWI-ST:8:1101:10491:2240#GTCCGC/1
abbceeeeggggfiiiiiigg`gfhfhhifhifdgg^ggdf_`_Y[aa_R
@HWI-ST:8:1101:19449:2134#GTCCGC/1
AAGAAGAGATCTGTGGACCA
到目前为止,我已经从每组四行中提取了第二行,并生成了一个包含每行长度记录的文件:
grep -v '[^A-Z]' file.fastq |awk '{ print length($0); }' > newfile
现在我只是在寻找一种指向该记录的方法,以指导 sed 命令确定要从行尾修剪多少字符。类似于:
sed -r 's/.{n}$//' file
用一些正则表达式替换 n 以引用文本文件。我想知道我是否让事情变得过于复杂,但我需要线条完全匹配,所以我一直无法想出另一种方法来解决它。任何帮助都会很棒,谢谢!
【问题讨论】:
-
总是第2行和第4行吗?只有那两个?