【发布时间】:2014-01-28 20:28:49
【问题描述】:
我正在开发一个应用程序来根据主题对文档进行聚类。我正在使用 LDA(潜在狄利克雷分配)算法。现在原型已经准备好了,并且有一些结果。
我正在寻找一种合理的方法来测试它。我目前的做法是分别打印出主题和一些相关文档。并手动评估它们。我可以想到以下测试点:
- 某个主题中的文档确实与该主题有关。
- 主题大不相同。
是否有任何最佳做法可以做到这一点?是否有任何客观指标而不是我的主观评价?
【问题讨论】:
标签: nlp data-mining text-mining