【发布时间】:2018-02-01 19:56:59
【问题描述】:
我想确定我的序列中特定感兴趣区域的位置和氨基酸变化,并将该信息存储在表格中。
是否可以通过使用 bioconductor 包在 R 中做这样的事情?我已经设法使用 DECIPHER 包中的 AlignSeqs() 对序列进行了简单的比对,但我无法自动提取序列中的差异。我从 FASTA 文件开始。
我想得到这样的结果:
Isolate ID Reference_AA Sample_AA Pos
1 S T 254
2 T D 200
3 L A 230
我有一个 74 AA 长的参考序列,我想查看与参考相比查询序列(比参考长得多)的差异,并在表格中列出结果。位置列与参考序列中的位置有关,与查询序列中的位置无关。我希望参考序列中的第一个 AA 从 68 开始,而不是 1。
我发现很难为此添加示例序列,因为它们往往很长,但这里有一些更短的东西可以使用(与上表无关):
>ref
VGRALPDVR
>query1
KSSYLDYAMSVIVGTALPDVRDGLKPVHRRVLY
>query2
ELKSSYLDYAMSVIVGRAAPDVRDGLKPV
预期输出:
ID Reference_AA Sample_AA Pos
query1 R T 70
query2 A L 72
【问题讨论】:
-
你能解释一下你的例子吗,什么是 ref、query1 和 2?
-
@zx8754 查询 1 和 2 是我想与参考序列 ref 进行比较的序列。查询序列与 ref 相比的差异是我想要列出的
-
query1 和 2 的预期输出是什么?
-
这个问题与生物序列分析的关系比与编程的关系更密切;我建议您将其发布/转移到 bioinformatics.stackexchange.com 或在 biostars.org 上询问(但不能同时使用两者)。
-
@zx8754 因为 ref 开头的“V”是位置 68,我在帖子中提到过。但是,定位并不那么重要,因为稍后可以使用 Pos + 68(如果“V”为 1)来修复它
标签: r bioinformatics bioconductor