【发布时间】:2017-01-20 23:11:49
【问题描述】:
This thread 包含有关如何获取组之间匹配字符串数的有用说明。但是,我想弄清楚每个类别的特定组有多少个字符串是唯一的。
例子:
Category Group Text_Strings
1 A string1
1 A string2
1 B string1
1 B string2
1 B string3
2 A string1
2 A string3
2 B string3
3 A string1
3 A string2
3 A string3
3 B string4
3 B string5
对于 B 组,该函数将返回类别 1 中的一个唯一字符串,类别 2 中没有唯一字符串,类别 3 中返回两个。
Category Count
1 1
2 0
3 2
对于 A 组,它将返回:
Category Count
1 0
2 1
3 3
按照其他线程上的建议,查找唯一字符串应该像这样简单:
df %>%
distinct %>%
group_by(category) %>%
summarise(uniques = sum(
strings[group == 'A'] %!in% strings[group == 'B']))
...但我不知道如何一次只为一个类别计算差异。是否有捷径可寻?非常感谢您的帮助!
【问题讨论】:
-
对于 A 组,它应该是 Count = [0, 1, 3]
-
感谢您发现错字
标签: r