【发布时间】:2022-05-08 04:27:51
【问题描述】:
我对 NLP 很陌生。请不要严格评判我。
我有一个关于客户反馈的非常大的数据框,我的目标是分析反馈。我在反馈中标记了单词,删除了停用词(SMART)。现在,我需要接收最常用词和最不常用词的表格。
代码如下:
library(tokenizers)
library(stopwords)
words_as_tokens <-
tokenize_words(dat$description,
stopwords = stopwords(language = "en", source = "smart"))
数据框如下所示:有很多反馈(可变“描述”)和提供反馈的客户(每个客户不是唯一的,可以重复)。我想收到一个包含 3 列的表格:a)客户名称 b)单词 c)它的频率。这个“排名”应该是按降序排列的。
【问题讨论】:
标签: r nlp text-mining