【发布时间】:2019-08-12 23:17:39
【问题描述】:
我已经使用 Gensim 在语料库上训练了一个 LDA 模型。现在我有了每个文档的主题分布,如何比较两个文档在主题中的相似程度?我想有一个总结措施。例如,以下是两个文档的主题分布。共有75个主题。为简洁起见,我只展示了前 10 个概率最大的主题(因此主题不按顺序排列)。 (40, 0.5523168) 表示主题 #40 对于 DOC #1 的概率为 0.5523168。我应该计算两个向量之间的欧几里得距离还是余弦距离?并且使用这个汇总度量,我可以说,例如,DOC 1 与 DOC2 比与 DOC3 更相似,或者 DOC1 和 DOC 2 在局部上比 DOC 3 和 DOC 4 更相似吗?谢谢!
DOC #1:
[(40, 0.5523168), (60, 0.12225048), (43, 0.07556598), (41, 0.065885976),
(22, 0.05838573), (24, 0.044774733), (74, 0.019839266), (65, 0.019544959),
(51, 0.015470431), (36, 0.013449047)]
DOC #2:
[(73, 0.58864516), (41, 0.16827711), (51, 0.09783472), (63, 0.06510383),
(24, 0.04722658), (32, 0.014467965), (44, 0.012267662), (47, 0.0031533625),
(18, 0.0022214972), (0, 1.2154361e-05)]
【问题讨论】: