【发布时间】:2018-04-07 05:05:48
【问题描述】:
data.table 非常有用,但我找不到解决以下问题的优雅方法。那里有一些更接近的答案,但没有一个能解决我的问题。 假设下面是 data.table 对象,我想根据基因对(Gene1 和 Gene2)过滤重复行,但两种方式都可以。
Gene1 Gene2 Ens.ID.1 Ens.ID.2 CORR
1: FOXA1 MYC ENSG000000129.13. ENSG000000129.11 0.9953311
2: EGFR CD4 ENSG000000129 ENSG000000129.12 0.9947215
3: CD4 EGFR ENSG000000129.12 ENSG000000129.11 0.9940735
4: EGFR CD4 ENSG000000129 ENSG000000129.12 0.9947215
如果 Gene1 和 Gene2 有这样的重复,那么我想得到这个:
Gene1 Gene2 Ens.ID.1 Ens.ID.2 CORR
1: FOXA1 MYC ENSG000000129.13. ENSG000000129.11 0.9953311
2: EGFR CD4 ENSG000000129 ENSG000000129.12 0.9947215
对数百万行进行标准编码非常慢。 在 data.table 中是否有一种优雅而快速的方法?
【问题讨论】:
-
你见过stackoverflow.com/a/25151395/496803 吗?这似乎正是您想要做的。
-
只是一个建议,因为我不知道需要多长时间,但也许您可以考虑创建一个新列,连接 GEN1 和 GEN2,然后删除重复项?
标签: r data.table