【发布时间】:2016-10-19 08:02:58
【问题描述】:
我有一个这样的输入数据框:
我希望输出是这样的:
例如,我想获取第一个值(玛丽有生命),针对所有其他具有重复 COL1 条目的行进行扫描,如果存在重复的 COL2 值,我需要在合并非重复项时单独消除重复项.换句话说,我想做模式搜索。如果同一模式出现在另一行中,我只想消除重复模式并合并非重复模式。
我尝试使用 grepl 和 gsub 函数,但无法正确获得我想要的结果。
在下面插入一个更简单的输入数据集:
COL1 COL2 10 玛丽有生命 10唐玛丽有生命 10布里托玛丽有生命 20 推他们 20 推他们的毛皮 30 对此大喊大叫 30 这是对这个大喊大叫 40年 40 小狗 40匹马
【问题讨论】:
-
请在添加一些代码(或像这样的数据示例)缩进时使用 4 个空格,这样它变得更具可读性,或者使用 dput(mydf)
-
我删除了我的答案,因为显然我不明白你希望它的处理方式。
-
您想在不分隔字符串的情况下获得一组独特的空格分隔模式吗?这真的没有意义......或者我仍然不明白你对解决方案的限制。
-
我编辑了帖子,以便现在有意义!