【发布时间】:2015-10-24 01:30:45
【问题描述】:
我的数据框如下所示:
NNC_009925.1 NC_009925.1 100.00 5356 0 0 5635975 5641330 1410850 1405495 0.0 9891
NC_009925.1 NC_009925.1 100.00 5356 0 0 1405495 1410890 5641330 5635975 0.0 9850
NC_009925.1 NC_009925.1 99.57 2788 12 0 3711607 3714394 1346122 1343335 0.0 5083
NC_009925.1 NC_009925.1 99.57 2788 12 0 1343335 1346122 3714394 3711659 0.0 5037
第 7 列和第 8 列代表一个范围 (Range1),而第 9 列和第 10 列代表第二个范围 (Range2)。我想删除数据框中 Range1 与 Range2 的任何行重叠的所有实例。保留的标准将基于最右侧列中的最高值。所以输出看起来像这样:
NC_009925.1 NC_009925.1 100.00 5356 0 0 5635975 5641330 1410850 1405495 0.0 9891
NC_009925.1 NC_009925.1 99.57 2788 12 0 3711607 3714394 1346122 1343335 0.0 5083
【问题讨论】:
-
很难看出什么是 col 7,8,9,10。大概是空格分隔,但在某些情况下,你有比其他更多的空间。一个空格也是分栏吗?这些范围之后似乎有两列。
-
重叠是指完全重叠,还是部分重叠已经足以删除一行?
-
第 7 列和第 8 列中的值是否在增加? (范围可能会减小,但您的情况是否如此?)第 9 列和第 10 列同上。
-
到目前为止你自己尝试过什么?
-
this 问题在本质上相似(即处理重叠范围)
标签: pandas