【问题标题】:append sequences from matching lines over a file using awk (or python)?使用awk(或python)将匹配行中的序列附加到文件上?
【发布时间】:2015-04-11 01:29:45
【问题描述】:

我正在尝试为每个人连接文件中的所有基因序列,并认为可能有一种方法可以通过使用 awk 或 sed 的 oneliner 来做到这一点。

假设我有一个带有 ID 名称(Mex1、Can2 等)和序列(TGAC...)的文件,并且每一行都有不同的 ID、基因(A、B)和序列。

Mex1_A TGACTT
Mex2_A TGACTA
CAN2_A TCGGGG
CAN4_A TCGACG
Mex1_B TCGGCA
Mex2_B TCGCCC
CAN2_B TCTACT
CAN4_B TCTACC

有没有办法从每个匹配的 ID 中附加序列,将每个人的所有序列数据连接在一行中,例如:

Mex1 TGACTTTCGGCA
Mex2 TGACTATCGCCC
CAN2 TCGGGGTCTACT
CAN4 TCGACGTCTACC

这可以使用那些编辑器吗?也许最好在 perl/python 中完成

【问题讨论】:

    标签: python awk sed


    【解决方案1】:
    $ awk -F'[_ ]' '{a[$1] = a[$1] $3} END{for (i in a) print i, a[i]}' file
    CAN4 TCGACGTCTACC
    Mex1 TGACTTTCGGCA
    Mex2 TGACTATCGCCC
    CAN2 TCGGGGTCTACT
    

    【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2013-11-27
    • 2013-01-23
    • 2013-11-03
    • 2016-08-27
    • 2017-09-20
    • 1970-01-01
    • 2014-05-27
    • 2015-02-11
    相关资源
    最近更新 更多