【发布时间】:2021-05-16 18:09:46
【问题描述】:
我想根据染色体列中的相似模式合并两个数据框。我对 R & BASH 进行了各种尝试,例如 "data.table" "tidyverse" 和 & merge()。有人可以通过在 R、BASH、Python、Perl 等中提供替代解决方案来帮助我解决这个解决方案吗?我想根据染色体信息合并并保留两个计数/RXN。
注意:这两个 DF 没有对齐,我也很好奇如果缺少某些值会发生什么。
感谢和欢呼:
DF1:
Chromosome;RXN;ID
1009250;q9hxn4;NA
1010820;p16256;NA
31783;p16588;"PNTOt4;PNTOt4pp"
203;3-DEHYDROQUINATE-DEHYDRATASE-RXN;"DHQTi;DQDH"
DF2:
Chromosome;Count1;Count2;Count3;Count4;Count5
203;1;31;1;0;0;0
1010820;152;7;0;11;4
1009250;5;0;0;17;0
31783;1;0;0;0;0;0
预期结果:
Chromosome;RXN;Count1;Count2;Count3;Count4;Count5
1009250;q9hxn4;5;0;0;17;0
1010820;p16256;152;7;0;11;4
31783;p16588;1;0;0;0;0
203;3-DEHYDROQUINATE-DEHYDRATASE-RXN;1;31;1;0;0;0
【问题讨论】:
-
所以
df1中的Chromosome1应该匹配df2中的Chromosome2? -
Chromosome1&Chromosome2在您的示例中没有匹配项。你想只加入这两个表吗? -
您能否详细说明“相似的匹配模式”对您的用例意味着什么?这听起来很主观,而编程解决方案最适合客观定义。
-
这里的预期结果似乎依赖于您提供的不同 DF2 数据,这将使我们无法测试任何潜在的解决方案。你能解决这个问题吗?
-
感谢大家迄今为止的反馈。我调整了两个数据集并澄清了问题。我想匹配两个文件中的“染色体”列标题