【发布时间】:2021-05-26 00:51:59
【问题描述】:
我有这个制表符分隔的文件:
gene 1 A 6 gene_name TP53 B
exon 6 B 2 2 A gene_name MYC2 10.0 B
transcript 3 B B 4 gene_name ORF1
如何打印第一列以及gene_name 列之后的下一列?如您所见,gene_name 并不总是存在于同一列中。
我不确定如何获得最后一部分:
awk 'BEGIN{OFS="\t"} {print $1, ??}' myFile.tsv
所以,我的预期输出是:
gene TP53
exon MYC2
transcript ORF1
谢谢!
【问题讨论】:
-
您甚至可以为此使用
sed,sed -nE 's/^(\S+).*\sgene_name(\s+\S+).*/\1\2/p' file(GNU) (demo)。