【发布时间】:2018-10-01 23:19:18
【问题描述】:
我想知道是否有人可以帮助我解决以下问题: 我正在尝试确定客户评论文本中停用词的数量(计数)。我在 R 中使用“quanteda”包停用词列表。 我使用以下代码标记了文本并过滤掉了停用词:
stop.words <- tokens_select(corpus2.tokens, stopwords())
但是,我现在无法保存这些结果,以便我可以计算每条评论中包含的实际停用词数量。
任何提示将不胜感激。提前致谢!
【问题讨论】:
-
请告诉我们您的确切预期输出是什么。
-
我想创建一个新变量,其中包含每条评论的停用词计数。例如句子“我从来没有吃过更好的拉猪肉披萨!他们在上面分层的浇头数量令人震惊......培根,玉米,更多拉猪肉,而且酱汁很美味。我和我分享了我的披萨其他 2 个人。我等不及要回去了。我想创建一个值为“21”的变量,因为它包含 21 个停用词。希望这能澄清吗?我对编码和stackoverflow都很陌生。感谢您的帮助!
-
为什么不简单地
lengths(tokens_select(corpus2.tokens, stopwords()))? -
嗨@StevenBeaupré,这更简单,正是我想要的 - 谢谢!
-
很高兴它有帮助!
标签: r text-mining stop-words