【问题标题】:Calculating topic distribution of an unseen document on GenSim计算 GenSim 上未见文档的主题分布
【发布时间】:2016-12-02 03:14:53
【问题描述】:

我正在尝试使用 GenSim 的 LDA 模块来完成以下任务

“用一个大文档训练一个 LDA 模型并跟踪 10 个潜在主题。给定一个新的、未见过的文档,预测 10 个潜在主题的概率分布”。

根据此处的教程:http://radimrehurek.com/gensim/tut2.html,这对于语料库中的文档似乎是可能的,但我想知道对于看不见的文档是否可能。

谢谢!

【问题讨论】:

    标签: python nlp gensim lda


    【解决方案1】:

    从您发布的文档看来,您可以像这样训练您的模型:

    >>> model = models.LdaModel(corpus, id2word=dictionary, num_topics=100)
    

    然后从this page 看来,您可以像这样将您的模型应用于“一个看不见的文档”:

    >>> doc_lda = model[doc_bow]
    

    其中doc_bow 是由doc2bow 工具生成的词袋。

    【讨论】:

    • 您能解释一下 doc_lda 是什么以及如何分析它吗?
    • doc_lda 也可以称为 'a' 或 'b' 它返回 doc_bow 的主题分配,如下所示:[(0, 0.33), (1, 0.33), (2, 0.33)] 所以主题后跟该评论/文档/文本数据属于该主题的百分比
    • 如何从上面提到的评论中提取主题名称。如果我有类似 text="The days are bright and good" 这样的文字。在我预定义的 lda 模型中有 10 个主题。它是否计算所有单词的主题概率?现在我假设我提到的文字是在停用词 stemmin 等之后
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2020-12-25
    • 2022-01-14
    • 2017-12-31
    • 2019-08-12
    • 2014-05-26
    • 2015-06-27
    • 1970-01-01
    相关资源
    最近更新 更多