【发布时间】:2015-08-24 13:58:48
【问题描述】:
这是一个关于 LDA 和 R 中的应用程序 LDAvis 的问题。由于这是我第一次使用这个包,我将不胜感激任何可以帮助我研究的帮助。
我希望能够查看每个主题根据概率定义的文档。我正在使用调查数据,并且正在查看评论部分并将它们中的每一个都定义为文档。
我将使用 cpsievert 的示例“电影评论的主题模型”,因为这与我的代码非常相似。完整代码可以在以下链接中找到:访问
http://cpsievert.github.io/LDAvis/reviews/reviews.html
我已经到了使用基于以下代码的 LDA 模型拟合模型的阶段:
set.seed(123)
fit <- lda.collapsed.gibbs.sampler(documents = documents, K = K, vocab = vocab,
num.iterations = G, alpha = alpha,
eta = eta, initial = NULL, burnin = 0,
compute.log.likelihood = TRUE)
然后使用LDAvis创建交互式html,代码如下:
json <- createJSON(phi = MovieReviews$phi,
theta = MovieReviews$theta,
doc.length = MovieReviews$doc.length,
vocab = MovieReviews$vocab,
term.frequency = MovieReviews$term.frequency)
现在基于交互式 html,我根据频率术语定义了主题。电影评论上有一个这样的例子,可以通过以下链接找到:
http://cpsievert.github.io/LDAvis/reviews/vis/#topic=7&lambda=0.6&term=
这个主题可以定义为电影评论的喜剧。
如果在本例中“topic7”被称为喜剧,您如何查看最有可能由该主题定义的评论?
我想知道,我将如何根据 topic7 定义文档然后能够查看它们,比如使用:
View(MovieReviwes$Topic7)
如果这个问题宽泛而冗长,我深表歉意,但如果有人可以通过使用我在链接中给出的示例来回答它,这将有很大帮助。提前致谢。
【问题讨论】:
-
您是否希望在 HTML 界面之外查看它们?
-
是的,如果我可以在 R 中查看它作为主题中的文档。
-
所以 topic7 会过滤掉文档
[7] ....funny..... jokes...和[1009] ......woody....hilarious等等
标签: r text-mining lda topic-modeling