【发布时间】:2020-09-22 06:37:07
【问题描述】:
我有几个适合约 500 万个文档的 gensim 模型。我想从每个模型中为每个主题提取前 100 个最具代表性的文档,以帮助我选择最佳模型。
假设我有一个模型lda和语料库corpus,我可以得到以下形式的主题概率:
topic_probs = lda[corpus]
其中topic_probs 是元组列表:(topic_num, topic_prob)。
如何按主题和概率对这个元组列表进行排序,然后从语料库中检索前 100 个文档?我猜答案看起来像method for assigning topics here,但我正在努力解决如何在维护文档索引的同时处理元组列表。
(这有点复杂,因为我不知道gensim.LdaModel 的minimum_probability 参数,因此概率
【问题讨论】: