【发布时间】:2018-11-08 10:41:18
【问题描述】:
我正在使用很棒的 quanteda 包将我的 dfm 转换为 topicmodels 格式。但是,在此过程中,我丢失了我需要用来确定哪些主题最有可能在我的文档中流行的文档变量。鉴于 topicmodels 包(与 STM 一样)仅选择非零计数,这尤其是一个问题。原始 dfm 中的文档数量和模型输出因此不同。我有什么方法可以正确识别 casu 中的文件吗?
【问题讨论】:
-
您能为我们创建一个最小的可重现示例吗?您正在使用相同的过程,但可能有一些虚拟文档。
-
不幸的是,我想不出在将 dfm 转换为 topicmodels 对象时丢失文档的示例数据。
-
你现在正在失去它们。因此,如果您采用诸如 data_char_ukimmig2010 之类的 quanteda 示例数据集之一并在您的代码中使用它,例如
my_corpus <- corpus(data_char_ukimmig2010, docvars = data.frame(party = names(data_char_ukimmig2010)))。然后按照您的代码查看 docvars 丢失的位置并将其添加到您的帖子中。
标签: r quanteda topicmodels