【发布时间】:2019-04-23 10:36:45
【问题描述】:
我有一个字符串,其中包含三个字母的氨基酸代码序列和 RNA 序列。我想按照它在字符串中出现的确切顺序提取氨基酸代码。
raw_seq = '''GGACUAGCGGAGGCUAGUCC
METGLNLYSGLYASNPHEARGASNGLNARGLYSTHRVAL
LYSCYSPHEASNCYSGLYLYSGLUGLYHISILEALALYS
ASNCYSARGALAPROARGLYSLYSGLYCYSTRPLYSCYS
GLYLYSGLUGLYHISGLNMETLYSASPCYSTHRGLUARG
GLNALAASN'''
ascodes = ['ALA','ARG','ASN','ASP','ASX','CYS','GLU','GLN','GLX','GLY','HIS','ILE','LEU','LYS','MET','PHE','PRO','SER','THR','TRP','TYR','VAL']
for amino in ascodes:
if amino in raw_seq:
print(amino)
我的代码按字母顺序返回氨基酸序列,这破坏了它的所有生物学功能。我也尝试了正则表达式,但我想不出一个合适的模式。
【问题讨论】:
-
您的预期结果是什么?
-
这看起来像是一个家庭作业,到目前为止你尝试了什么?
-
嗨@Peet 不要忘记提供一些反馈,以便我们知道我们是否为您解决了问题,请参阅What should I do when someone answers my question?
标签: python string substring match bioinformatics