【发布时间】:2021-02-13 08:08:12
【问题描述】:
如果我有一个包含 4 列的 .txt 文件,如下所示:
File Genus Species Strain
KPLB.S001.gbk Corynebacterium tuberculostearicum S001
KPLB.S098.gbk Corynebacterium propinquum S098
KPLB.S045.gbk Corynebacterium tuberculostearicum S045
KPLB.S690.gbk Dolosigranulum pigrum S690
还有一个文件夹,其中包含第一列中列出的 4 个 .gbk 文件。如何根据表格将 .gbk 文件中出现的“Genus”、“Species”或“Strain”一词替换为相应的名称?
感谢任何指导。谢谢!
添加有关 .gbk 文件内部外观的信息:
LOCUS NBOOEINI_1 375100 bp DNA linear 19-OCT-2020
DEFINITION Genus species strain strain.
ACCESSION
VERSION
KEYWORDS .
SOURCE Genus species
ORGANISM Genus species
Unclassified.
COMMENT Annotated using prokka 1.14.6 from
https://github.com/tseemann/prokka.
FEATURES Location/Qualifiers
source 1..375100
/organism="Genus species"
/mol_type="genomic DNA"
/strain="strain"
这是想要的输出
LOCUS NBOOEINI_1 375100 bp DNA linear 19-OCT-2020
DEFINITION Corynebacterium tuberculostearicum strain S001.
ACCESSION
VERSION
KEYWORDS .
SOURCE Corynebacterium tuberculostearicum
ORGANISM Corynebacterium tuberculostearicum
Unclassified.
COMMENT Annotated using prokka 1.14.6 from
https://github.com/tseemann/prokka.
FEATURES Location/Qualifiers
source 1..375100
/organism="Corynebacterium tuberculostearicum"
/mol_type="genomic DNA"
/strain="S001"
strains 这个词会更复杂,因为我只需要更改 DEFINITION 行中的第二个匹配项以及最后一行
【问题讨论】:
-
在我的脑海中,您可以使用
ls或find遍历文件,然后对于每个文件,然后使用cut抓取字段,然后您可以生成一个将第 1 列中的值的所有实例替换为第 2 列中的值的单行代码。如果您发布.gbk文件的示例,我应该能够提供更好的帮助。 -
感谢 ShawnMilo,我用 .gbk 文件的信息更新了问题
-
"那么您可以生成一个单行代码,将第 1 列中的值的所有实例替换为第 2 列中的值。"那是我比较难的部分