【发布时间】:2019-07-18 16:45:07
【问题描述】:
我正在使用整洁的文本指南进行文本挖掘并更改为代码以用于我自己的数据。
我正处于绘制数据集中最常用词的阶段。我已经设法将它们放入数据框中。
我已尝试更改代码的某些部分,但这无济于事,因为我不完全确定每个位的作用。我也在网上到处找答案!
我的数据框如下所示:
# A tibble: 1,343 x 2
word n
<chr> <int>
1 reminders 104
2 check 100
3 checks 100
4 mot 87
5 car 82
6 vehicle 79
7 send 78
8 people 73
9 maintenance 44
10 vehicles 42
绘制最常用词的代码如下所示:
library (ggplot2)
frequentwordsstop %>%
count(word, sort = TRUE) %>%
filter(n > 40) %>%
mutate(word = reorder(word, n)) %>%
ggplot(aes(word, n)) +
geom_col() +
xlab (NULL) +
coord_flip()
我得到的是 x 轴标签上带有“n”的空白正方形。就是这样!
我没有收到任何错误消息。我得到的是 x 轴标签上带有“n”的空白正方形。就是这样!
【问题讨论】:
-
当我使用非 tidyverse 方法时,我得到了预期的情节。如果您发布的 tibble 是
frequentwordsstop,count(word, sort = TRUE)不会对每个单词计数一次并将计数设置为 1?另一件事可能是意外的包命名空间可能会覆盖reorder()函数(您是否看到使用?reorder时出现多个选项?) -
嗨,我尝试过使用 ?reorder,它提供了描述 reorder 是一个通用函数的帮助文档(这是在 RStudio 中)。所以我认为没有其他东西覆盖它。我认为 count(word, sort = TRUE) 正在对单词的频率进行排序,例如我会得到一个条形图,首先是最常用的单词(提醒),然后是第二个,(检查)等。您能否复制过去的非 tidyverse 方法可能会对我有所帮助?感谢回复!