【问题标题】:How to evaluate the best K for LDA using Mallet?如何使用 Mallet 评估 LDA 的最佳 K?
【发布时间】:2015-10-22 03:11:06
【问题描述】:

我正在使用 Mallet api 从 twitter 数据中提取主题,我已经 提取的主题似乎很好。但我面临问题 估计K。

例如,我将 K 值从 10 固定为 100。 因此,我从数据中提取了不同数量的主题。 但是,现在我想估计哪个 K 是最好的。 有一些我知道的算法

  1. 困惑
  2. 经验可能性
  3. 边际似然(调和平均法)
  4. 剪影

我发现了一个方法 model.estimate() 可以用来估计不同的 K 值。 但我没有任何想法表明 K 的值最适合模型。 有没有人通过一些示例代码给出一些想法?谢谢。

【问题讨论】:

  • 考虑 gensim Hdpmodel(分层狄利克雷过程)。

标签: cluster-analysis lda topic-modeling mallet


【解决方案1】:

我认为最好的算法是人类判断。创建具有不同主题数量的主题模型并查看它们并选择您喜欢的内容。有时您想微调主题的数量(例如,您不希望将某个主题分成两个,或者您希望某个主题存在而不合并到另一个主题中)。

【讨论】:

  • 但是,起初我想使用 Mallet 的任何一种算法来估计 K。
猜你喜欢
  • 1970-01-01
  • 2019-03-21
  • 2021-10-05
  • 2017-11-28
  • 2018-05-13
  • 2012-12-17
  • 2017-10-23
  • 1970-01-01
  • 2018-06-07
相关资源
最近更新 更多