【发布时间】:2017-07-03 10:06:48
【问题描述】:
假设我的数据如下所示:
vector = c("Happiness with KK Happiness without KK", "I love some coding I love major coding", "fun 2 fun 3")
我想删除所有重复的单词,包括每个重复单词的第一个实例。所以,我的输出应该是这样的:
[1] "with without"
[2] "some major"
[3] "2 3"
基本上和这个问题类似:How do keep only unique words within each string in a vector。但是我不想保留重复单词的第一个实例。
我尝试使用strsplit() 以及" " 和duplicated() 将每个字符串拆分为不同的单词,然后检测重复项。
使用duplicated() 的问题在于它只返回重复单词的second 实例的逻辑向量。此外,使用strsplit() 以列表的形式给我输出,这确实使事情变得复杂,例如,当我想获得重复单词的子集时(通常像df[duplicated(df)] 这样的东西不适用于列表)。
【问题讨论】:
标签: r string text duplicates