【发布时间】:2020-11-23 22:03:40
【问题描述】:
我正在使用nano 中的以下命令处理一个项目:
from Bio import SeqIO
import sys
import re
fasta_file = (sys.argv[1])
for myfile in SeqIO.parse(fasta_file, "fasta"):
if len(myfile) > 250:
gene_id = myfile.id
mylist = re.match(r"H149xcV_\w+_\w+_\w+", gene_id)
print (">"+list.group(0))
及其提供以下输出:
>H149xcV_Fge342_r3_h2_d1
>H149xcV_bTr423_r3_h2_d1
>H149xcV_kN893_r3_h2_d1
>H149xcV_DNp021_r3_h2_d1
>H149xcV_JEP3324_r3_h2_d1
>H149xcV_JEP3324_r3_h2_d1
>H149xcV_JEP3324_r3_h2_d1
>H149xcV_JEP3324_r3_h2_d1
>H149xcV_SRt424234_r3_h2_d1
>H149xcV_SRt424234_r3_h2_d1
>H149xcV_SRt424234_r3_h2_d1
>H149xcV_SRt424234_r3_h2_d1
我如何更改我的命令,以便它为我提供唯一:
>H149xcV_Fge342_r3_h2
>H149xcV_bTr423_r3_h2
>H149xcV_kN893_r3_h2
>H149xcV_DNp021_r3_h2
>H149xcV_JEP3324_r3_h2
>H149xcV_SRt424234_r3_h2
【问题讨论】: