【发布时间】:2014-09-06 09:34:04
【问题描述】:
我正在尝试将 MedLine 文件解析为 0,1 表以执行一些统计下游分析:PCA、GWAS 等。我使用名为 Bio.Medline 的 Python 模块和一些额外的 shell 命令对其进行了格式化。现在,我不知道如何继续。
我需要将 File 1, - 每行一张纸和制表符分隔的关键字的键值文件 - 转换为包含折叠关键字和关键字的存在/不存在显示为 1 或 0 值的文件。
我想用 Perl 来做这件事,但欢迎使用其他解决方案。
谢谢,伯纳多
File 1:
19801464 Animals Biodiversity Computational Biology/methods DNA
19696045 Environmental Microbiology Computational Biology/methods Software
期望的输出:
Animals Biodiversity Computational Biology/methods DNA Environmental Microbiology Software
19801464 1 1 1 0 0
19696045 0 1 0 1 1
【问题讨论】:
-
第一次通过的方法是遍历所有关键字并将它们放入一个数组中。现在,通过文档的行和每个 paperID,在哈希对象(Ruby 中的
papers["19801464"])中创建一个新对象,并根据关键字的存在为该哈希分配每个关键字的键和值 0 或 1在那一行(Ruby 中的papers["19801464"]["Animal Biodiversity"] = 1)。 -
不应该在您想要的输出中记录
19696045在“环境微生物学”的第 4 列中有一个“1”? -
是的 G. Cito,我更新了它。
-
我转到 PCA 步骤,这里是:stats.stackexchange.com/questions/108148/…
标签: python perl parsing bioinformatics bioperl