【发布时间】:2013-11-23 01:29:42
【问题描述】:
当 DNA 序列中存在某种模式时,我想检索编码氨基酸。例如,模式可以是:ATAGTA。所以,当有:
输入文件:
>sequence1
ATGGCGCATAGTAATGC
>sequence2
ATGATAGTAATGCGCGC
理想的输出将是一个表格,其中每个氨基酸的次数由模式编码。在序列 1 中,模式只编码一个氨基酸,但在序列 2 中,它编码两个。我想让这个工具可以扩展到数千个序列。我一直在考虑如何完成这项工作,但我只想:替换所有与模式不同的核苷酸,翻译剩余的内容并获取编码氨基酸的摘要。
请让我知道此任务是否可以由现有工具执行。
感谢您的帮助。一切顺利,贝尔纳多
编辑(由于我的帖子产生的混乱):
请忘记原帖和sequence1和sequence2。
大家好,很抱歉造成混乱。输入的 fasta 文件是使用“FeatureExtract”工具 (http://www.cbs.dtu.dk/services/FeatureExtract/download.php) 从 GenBank 文件派生的 *.ffn 文件,因此可以想象它们已经在帧 (+1) 中,不需要对氨基酸进行编码在不同于 +1 的框架中。
我想知道以下序列编码的是哪种氨基酸:
AGAGAG
GAGAGA
CTCTCT
TCTCTC
我想获得编码氨基酸的唯一字符串是三个 AG、GA、CT 或 TC 的重复,分别是 (AG)3、(GA)3、(CT)3 和 (TC)3。我不希望程序检索四个或更多重复的编码氨基酸。
再次感谢,伯纳多
【问题讨论】:
-
模式
ATAGTA没有出现在任何序列中? -
@Jotne:确实如此:
ATGGCGC<ATAGTA>ATGC,ATG<ATAGTA>ATGCGCGC。不过,我不明白“两个人的代码”是什么意思。 -
BioPerl 可能对你有用:bioperl.org/wiki/Main_Page
-
“两个代码”是什么意思?我在序列 2 中只看到一个 ATAGTA 实例。
-
还有其他人注意到,几乎所有发布在这个网站上的关于 DNA 的问题都有大量关于 DNA 的信息,而几乎没有任何信息可以帮助我们弄清楚发帖者想用他们的文本文件做什么? @popnard - 只需发布示例输入、预期输出并根据文件中的字符串模式告诉我们您需要做什么,删除所有 DNA 术语,因为它只会混淆您的问题。
标签: regex perl bioinformatics biopython bioperl