【发布时间】:2020-03-18 01:03:14
【问题描述】:
作为一个新手,我正在努力用一个大数据集解决以下问题。 我想在“CHROM”列中查找比较两列 CLONEID 的值(第二列包含重复项)。 相应的“CHROM”值将归属于每个“CLONEID”,而相同的值将归属于其副本。我写这张表作为例子:
CLONEID | CHROM
976803 | 2A
976877 | 5B
976952 | 6B
976961 | 3B
976975 | 1A
977084 | 7B
977228 | 4A
977241 | 3A
我想获得以下输出:
CLONEID | CHROM
976803 |2A
976877 |5B
976952 |6B
976961 |3B
976975 |1A
977084 |7B
977084_1 |7B
977228 |4A
977228_1 |4A
977228_2 |4A
977228_3 |4A
977241 |3A
【问题讨论】:
-
如何确定需要复制哪一行以及复制多少次?
-
很难理解您的期望,因为第一个表不包含出现在第二个表中的大多数条目,因此我们无法进行关联并确定规则是什么。也许如果你做了一个更长的例子。另外,当它们具有相同的 CHROM 时,CLONEDID 是否会使用尾随序列号重命名?
-
@user2332849 是的,我同意。对不起,我没有包括第一个条目。我现在做了更正。是的,当 CLONEID 追求相同的 CHROM 时,它们会以序列号重命名。
-
@RonakShah 我已经知道应该复制的特定行。因此,可以像 VLOOKUP 一样运行的代码检测例如 977084 并将 CHROM 归因于 977084 和 977084_... 基本上,977084=977084_1=977084_2。
-
告诉
977084的信息在哪里。需要重复 2 次和 977228 4 次。为什么只有 2 次和 4 次而不是 1、3 或 10 次?