【发布时间】:2016-09-07 16:06:41
【问题描述】:
我有一个看起来像这样的文件,其中包含大量数据
>ENSMUSG00000020333|ENSMUST00000000145|Acsl6
AGCTCCAGGAGGGCCCGTCTCAGTCCGATGAACTTTGCAGCAATATTATAGTTATTCGTG
GTTCACAGAATTCCATTAAACATAAAGAAAAAACATAA
>ENSMUSG00000000001|ENSMUST00000000001|Gnai3
GAGGATGGCATAGTAAAAGCTATTACAGGGAGGAGTGTTGAGACCAGATGTCATCTACTG
CTCTGTAATCTAATGTTTAGGGCATATTGAAGTTGAGGTGCTGCCTTCCAGAACTTAAAC
应转换列,以便行始终包含:
ENSMUSG*** ENSMUST*** GeneName Sequence (four separate columns)
序列列应该是以 A、C、G 或 T 开头的行融合到一个文本单元格中,要融合的单元格数量因基因而异。
有没有人建议如何解决这个问题?
非常感谢您的帮助! 最良好的祝愿 kk
【问题讨论】:
-
数据 > 文本到列 > "|"分隔符
-
例如,INPUT A1 ">ENSMUSG00001 | ENSMUST00017 | Gnai3" ... A2 "AGATACAGCC" ... A3 "GTACATCTAC" ... A4 "CTATTCAAGCATAC" ... A5 "> ENSMUSG00002 | ENSMUST000023 | Asic2" ... 等...带有文本到列或导入功能“|”作为分隔符 ... OUTPUT ... A1 ">ENSMUSG00001" ... B1 "ENSMUST00017" .... C1 "Gnai3" ... D1 现在应该是 =A2&A3&A4 .... 包含序列部分的单元格数是变量,可以在 2 到 10 之间 ...