【发布时间】:2017-12-18 16:04:15
【问题描述】:
我需要在文本字符串中搜索关键字,然后在 R 数据框中分配一个类别。这会产生一个问题,即我有多个类别的关键字。我想轻松提取代表多个类别的行,以便我可以手动评估它们并分配正确的类别。
为此,我尝试添加一个计数列来显示每个字符串中代表了多少个类别。
使用下面链接的两种解决方案的组合,我已经设法获得了一部分,但我仍然没有得到正确的输出
Partial animal string matching in R
Count occurrences of specific words from a dataframe row in R
我在下面创建了一个示例。我希望应用以下规则:
如果字符串有猫或狮子 wcount 得到 1 - 仅代表 1 个组(猫)
如果字符串有 dog 或 wolf wcount 得到 1 - 仅代表 1 个组(犬)
如果字符串有(猫或狮子)和(狗或狼)wcount 得到 2 - 代表两组(猫和犬)
然后我可以轻松地拉出 wcount > 1 的行
id <- c(1:5)
text <- c('saw a cat',
'found a dog',
'saw a cat by a dog',
'There was a lion',
'Huge wolf'
)
dataset <- data.frame(id,text)
SearchGrp<-list(c("(cat|lion)", "feline"),
c("(dog|wolf)","canine"))
output_vector<- character (nrow(dataset))
for (i in seq_along(SearchGrp)){
output_vector[grepl(x=dataset$text, pattern = SearchGrp[[i]][1],ignore.case = TRUE)]<-SearchGrp[[i]][2]}
dataset$type<-output_vector
keyword_temp <- unlist(lapply(SearchGrp, function(x) new<-{x[1]}))
keyword<-paste(keyword_temp[1],"|",keyword_temp[2])
library(stringr)
getCount <- function(data,keyword)
{
wcount <- str_count(dataset$text, keyword)
return(data.frame(data,wcount))
}
getCount(dataset,keyword)
【问题讨论】: