【发布时间】:2020-04-24 22:13:06
【问题描述】:
当使用 GFF.write() 创建文件时,我得到一个新行,以“annotation remark”作为源,然后是序列区域的 ASCII 编码:
##gff-version 3
##sequence-region NC_011594.1 1 16779
NC_011594.1 annotation remark 1 16779 . . . gff-version=3;sequence-region=%28%27NC_011594.1%27%2C 0%2C 16971%29,%28%27NC_042493.1%27%2C 0%2C 132544852%29, (continues on and on)
NC_011594.1 RefSeq gene 1 1531 . + . Dbxref=GeneID:7055888;ID=gene-COX1;Name=COX1;gbkey=Gene;gene=COX1;gene_biotype=protein_coding
知道它为什么在这里,它的用途以及我如何避免它?我担心在第三方软件中使用它可能会成为问题。
我只导入了 bcbio-gff 包,但我相信它是 Biopython 的一部分,链接:https://biopython.org/wiki/GFF_Parsing
【问题讨论】:
-
一个可重现的例子会很好:) 在那之前很难知道什么可能是错的。 github.com/biocore-ntnu/pyranges 也可以读/写 GFF,不知道能不能解决你的问题。
-
我做了什么:从 GFF 文件中提取信息(使用 GFF.parse() 和 limit_info 是一些基因),然后将其直接发送到 GFF.write() 以创建一个新文件只有选定的基因
-
这个问题可能会在生物信息学stackexchange网站得到更多答案:bioinformatics.stackexchange.com
标签: python bioinformatics biopython gff