【发布时间】:2017-11-01 16:11:27
【问题描述】:
这是我拥有的染色体数据(3.2GB)。对于每 2 行,我采用第 3 列的特定 id(# 之后的部分是不必要的)。我将这些 ID 写在一个文本文件中。现在它的大小是 1.2 GB。我需要从该 Ids.txt 文件中获取一个 id,并从染色体文件中找到两对并获取它们的第 0 列和第 1 列及其 id。例如:假设我这样做是为了
ID = HWI-ST1113_0139:6:1309:6672:91333。
结果必须是
HWI-ST1113_0139:6:1309:6672 chr1 807003 chr1 805329
我无法为此创建适当的算法,而且我是 pandas 和 numpy 的新手。 如果你能帮助我会appriciate那些家伙。谢谢你。
0 . 1 . 2 . 3 .
chr1 42559 42609 HWI-ST216_0359:4:1106:4167:41680#AT.AAG/1 26 -
chr1 96644 96694 HWI-ST1113_0139:5:2205:21258:88747#..GGT./1 25 -
chr1 228403 228452 HWI-ST1113_0139:5:1115:14469:39910#....../1 19 +
chr1 532565 532615 HWI-ST216_0359:4:1313:3216:51668#C.G.C./1 23 -
chr1 557412 557462 HWI-ST1113_0139:5:1205:9402:77620#..G.../1 30 -
chr1 807003 807051 HWI-ST1113_0139:6:1309:6672:91333#.G...A/1 42 -
chr1 805329 805379 HWI-ST1113_0139:6:1309:6672:91333#.G...A/2 26 +
【问题讨论】:
标签: python pandas numpy dataframe