【发布时间】:2015-10-22 03:11:06
【问题描述】:
我正在使用 Mallet api 从 twitter 数据中提取主题,我已经 提取的主题似乎很好。但我面临问题 估计K。
例如,我将 K 值从 10 固定为 100。 因此,我从数据中提取了不同数量的主题。 但是,现在我想估计哪个 K 是最好的。 有一些我知道的算法
- 困惑
- 经验可能性
- 边际似然(调和平均法)
- 剪影
我发现了一个方法 model.estimate() 可以用来估计不同的 K 值。 但我没有任何想法表明 K 的值最适合模型。 有没有人通过一些示例代码给出一些想法?谢谢。
【问题讨论】:
-
考虑 gensim Hdpmodel(分层狄利克雷过程)。
标签: cluster-analysis lda topic-modeling mallet