【发布时间】:2020-09-19 05:51:50
【问题描述】:
我目前正在分析两个数据集。数据集 A 有大约 600000 多个文档,而数据集 B 有大约 7000 多个文档。这是否意味着主题输出将更多地与数据集 A 相关,因为它具有更大的 N? Rapidminer 中 mallet 的输出仍然说明了每个主题下的文档。我想知道是否有办法让两个数据集以相等的权重解释?
【问题讨论】:
标签: mallet
我目前正在分析两个数据集。数据集 A 有大约 600000 多个文档,而数据集 B 有大约 7000 多个文档。这是否意味着主题输出将更多地与数据集 A 相关,因为它具有更大的 N? Rapidminer 中 mallet 的输出仍然说明了每个主题下的文档。我想知道是否有办法让两个数据集以相等的权重解释?
【问题讨论】:
标签: mallet
我假设您将训练语料库中的两个文档完全混合并执行训练。在这种假设下,主题输出很可能更多地是关于“来自”A 而非 B 的数据集,因为 Gibbs 采样将根据最有可能来自 A 的令牌的共现来构建主题.然而,跨两个数据集的主题间或主题相似性重叠也是可能的。
您可以改为对文档 A 进行抽样,使其具有与 B 相同数量的文档,假设它们的主题结构没有那么不同。或者,您可以检查 --output-state 参数的日志输出,以准确查看为每个令牌分配的主题 (z)。
【讨论】: