【问题标题】:How to test a text clustering application?如何测试文本聚类应用程序?
【发布时间】:2014-01-28 20:28:49
【问题描述】:

我正在开发一个应用程序来根据主题对文档进行聚类。我正在使用 LDA(潜在狄利克雷分配)算法。现在原型已经准备好了,并且有一些结果。

我正在寻找一种合理的方法来测试它。我目前的做法是分别打印出主题和一些相关文档。并手动评估它们。我可以想到以下测试点:

  • 某个主题中的文档确实与该主题有关。
  • 主题大不相同。

是否有任何最佳做法可以做到这一点?是否有任何客观指标而不是我的主观评价?

【问题讨论】:

    标签: nlp data-mining text-mining


    【解决方案1】:

    1.经过训练,我们得到主题词矩阵P(z|w),每一行都是词的概率分配给主题,所以你可以打印出每个主题的前N个词,并评估它们,它与带有文档的 eval 主题相比会很容易

    2.我认为你在这里问的问题是训练是否收敛,我只是评估 P(z|w) ,当 P(z|w) 稳定时,这意味着模型收敛于参数 ( alpha,beta,topic_num) 我们选择。当我们调整主题 num 时,我们可以得到关于所有 topic_num 的稳定 P(z|w),我们选择 topic_num 相对于最大值 P(z|w) 。你可以参考论文 http://psiexp.ss.uci.edu/research/papers/sciencetopics.pdf

    3.关于如何调整 alpha beta,以及调整 topic_num 的有效方法,Hanna M. Wallach 对此做了很多研究,我只是凭直觉做的,因为数据集太大http://people.cs.umass.edu/~wallach/

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-03-20
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2010-11-30
      • 2011-07-04
      • 2010-09-21
      • 1970-01-01
      相关资源
      最近更新 更多