【问题标题】:find overlapping genomic coordinates in more than two datasets在两个以上的数据集中找到重叠的基因组坐标
【发布时间】:2015-04-16 04:46:01
【问题描述】:

我想比较并获取三个不同数据集中的重叠区域。比较也应该基于 CNA。

 data1
      chr start         end       CNA
        1   170900001   171500001   loss
        1   11840001    19420001    loss
        1   60300001    62700001    gain
        1   25520001    25820001    gain

data2
    chr  start       end        CNA
    1   170940001   171500001   gain
    1   60300001    62700001    gain
    1   25520001    25840001    gain
    1   119860001   123040001   loss
    1   171500001   171580001   gain
    1   79240001    84420001    gain


data 3
chr  start       end        CNA
1   170950001   171500001   gain
1   60300001    62700001    loss
1   25530001    25840001    gain

预期输出

   chr  start       end        CNA
    1   170950001   171500001   gain
    1   25530001    25840001    gain

我使用 GenomicRanges 进行比较。首先,我尝试根据“增益”和“损失”对基因组区域进行排序。然后我分别在每个组之间使用 findOverlaps 例如。 df1

【问题讨论】:

  • 如果您正在寻求有关 GenomicRanges 的专家帮助,请考虑在 Bioconductor support site 上提问。我认为答案正是我认为您正在做的事情——findOverlaps() 用于 data1 和 data2,然后是结果和 data3。
  • this SO answer 能解决您的问题吗?

标签: r bioconductor


【解决方案1】:

我做了ask a similar question several days ago。你没有提到 GenomicRanges 是否对你有用。我发现图书馆 IRange 对我来说确实工作得更好。也许我的方法对你有用

【讨论】:

  • 我尝试了 GenomicRanges intersect,对我来说效果很好。
猜你喜欢
  • 1970-01-01
  • 2021-06-12
  • 1970-01-01
  • 1970-01-01
  • 2016-04-20
  • 1970-01-01
  • 1970-01-01
  • 2013-10-20
  • 1970-01-01
相关资源
最近更新 更多