【发布时间】:2012-12-25 09:18:43
【问题描述】:
我一直在使用 findAssoc() 和文本挖掘(tm 包),但我意识到我的数据集似乎有些不对劲。
我的数据集是保存在一列 csv 文件中的 1500 个开放式答案。
所以我像这样调用数据集并使用典型的tm_map 使其进入语料库。
library(tm)
Q29 <- read.csv("favoritegame2.csv")
corpus <- Corpus(VectorSource(Q29$Q29))
corpus <- tm_map(corpus, tolower)
corpus <- tm_map(corpus, removePunctuation)
corpus <- tm_map(corpus, removeNumbers)
corpus<- tm_map(corpus, removeWords, stopwords("english"))
dtm<- DocumentTermMatrix(corpus)
findAssocs(dtm, "like", .2)
> cousin fill ....
0.28 0.20
第一季度。当我找到与 like 关联的术语时,我看不到输出 like = 1 作为输出的一部分。不过,
dtm.df <-as.data.frame(inspect(dtm))
这个数据框由 1500 个 obs 组成。 1689个变量..(或者是因为数据保存在一行csv文件中?)
第二季度。即使cousin 和fill 出现一次,而目标词like 出现一次,但得分是不同的。他们不应该一样吗?
我正在尝试找到findAssoc() 的数学运算,但还没有成功。任何建议都非常感谢!
【问题讨论】:
-
CRAN 上没有“文本挖掘”包。请包含您使用的 library() 或 require() 调用。
-
@Dwin - 似乎在包 'tm' - inside-r.org/packages/cran/tm/docs/findAssocs
-
@thelatemail - 感谢您的编辑!
标签: r text-mining