【问题标题】:Coherence and Diagnostics File in MalletMallet 中的一致性和诊断文件
【发布时间】:2021-02-19 20:44:11
【问题描述】:

在 Mallet 中,我们可以获得一个诊断文件,包括测量每个主题的连贯性 http://mallet.cs.umass.edu/diagnostics.php。在 Gensim 中,我们对每组主题有一个总分,对每个主题有一个单独的得分 (https://radimrehurek.com/gensim/models/coherencemodel.html)。我有两个问题:

1- Mallet 诊断文件中的相干方法的名称是什么?

2- 如果我们想使用 Mallet 诊断文件中的连贯性分数来衡量总分,我们可以只测量连贯性分数的平均值吗?

【问题讨论】:

    标签: gensim topic-modeling mallet


    【解决方案1】:
    1. 我见过它称为 UMass 方法,我不知道是否有标准命名法。有关一般处理,请参阅Röder et al。重要的变量是参考语料是否与训练语料相同(是的,所以认为它是一个上限),统计量是概率还是文档频率(df),方程的形式(条件概率而不是PMI)和平滑因子(很小,所以从不同时出现的词会产生很大的不同)。

    2. 你可以,但分配很重要。一些非常烂的主题可能会破坏用户信心,而不是许多主题的微小差异。这些基于共现的连贯性指标需要担心的主要问题是冗余。用经常一起出现的高频词创建大量相同的主题是微不足道的。

    【讨论】:

    • 作为他第二点的旁注,确保您不会获得冗余主题的一个好方法是计算主题集的主题多样性,如 Dieng 等人所述。 cs.columbia.edu/~blei/papers/DiengRuizBlei2020a.pdf
    • 大卫,你知道为什么我在主题数为 2 时获得最高的平均一致性值吗?这意味着少于 10 个主题的数量始终获得最高的连贯性平均值。我对包含数百万个文档的不同数据集进行了尝试。
    • 这是连贯性的另一个病态案例,类似于冗余主题。想想退化的单主题模型的热门词:它只是语料库频率。高频词很可能同时出现,所以连贯性很好。
    猜你喜欢
    • 1970-01-01
    • 2021-05-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-09-26
    • 1970-01-01
    • 2021-09-16
    • 1970-01-01
    相关资源
    最近更新 更多