【问题标题】:EM soft clustering in lingpipelingpipe中的EM软聚类
【发布时间】:2013-04-17 10:24:10
【问题描述】:

在 Lingpipe 的 EM 教程中,他们说可以在没有监督数据的情况下运行算法:

可以通过让初始分类器随机分配类别来以完全无监督的方式训练分类器。只有类别的数量必须是固定的。算法完全一样,收敛后的结果或者最大epoch数就是分类器。

但是他们的课程TradNaiveBayesClassifier 需要一个标记和一个未标记的语料库才能运行。如何修改它以在没有标记数据的情况下运行?

【问题讨论】:

    标签: unsupervised-learning expectation-maximization


    【解决方案1】:

    EM 是一种概率最大似然优化算法。一般来说,它适用于无监督算法(用于聚类),例如 PLSA、高斯混合模型。

    我认为 linepipe 文档是说您可以使用所有数据标签的随机初始化(每个数据的标签分布),然后输入 NB 以计算 ELBO(证据下限),然后将其最大化以获取更新参数。

    简而言之,您将需要使用 NB 来编写 M 步骤 --- 更新模型参数。

    【讨论】:

      猜你喜欢
      • 2014-09-12
      • 2018-12-13
      • 2017-03-05
      • 2023-03-03
      • 2020-01-30
      • 2014-07-21
      • 1970-01-01
      • 2011-07-14
      • 2015-06-22
      相关资源
      最近更新 更多