【问题标题】:Latent Dirichlet Allocation and Analyzing Two Data Sets using MALLET潜在狄利克雷分配和使用 MALLET 分析两个数据集
【发布时间】:2020-09-19 05:51:50
【问题描述】:

我目前正在分析两个数据集。数据集 A 有大约 600000 多个文档,而数据集 B 有大约 7000 多个文档。这是否意味着主题输出将更多地与数据集 A 相关,因为它具有更大的 N? Rapidminer 中 mallet 的输出仍然说明了每个主题下的文档。我想知道是否有办法让两个数据集以相等的权重解释?

【问题讨论】:

    标签: mallet


    【解决方案1】:

    我假设您将训练语料库中的两个文档完全混合并执行训练。在这种假设下,主题输出很可能更多地是关于“来自”A 而非 B 的数据集,因为 Gibbs 采样将根据最有可能来自 A 的令牌的共现来构建主题.然而,跨两个数据集的主题间或主题相似性重叠也是可能的。

    您可以改为对文档 A 进行抽样,使其具有与 B 相同数量的文档,假设它们的主题结构没有那么不同。或者,您可以检查 --output-state 参数的日志输出,以准确查看为每个令牌分配的主题 (z)。

    【讨论】:

      猜你喜欢
      • 2011-05-07
      • 2011-09-08
      • 2020-07-21
      • 2017-08-12
      • 2017-04-01
      • 1970-01-01
      • 1970-01-01
      • 2014-09-24
      • 2012-10-02
      相关资源
      最近更新 更多