【发布时间】:2016-02-09 09:36:59
【问题描述】:
我需要一种方法来澄清以下数据集的主导主题,以下数据集是在预处理所有文档后产生的,
以下选定的主题频率如下:
TOPICS
id Doc-name total words Politics sport food animals
1 doc1 1000 300 250 100 350
2 doc2 2000 1000 400 200 400
3 doc3 4000 500 300 2000 200
etc...
问题是: 这种数据集有什么分类方法吗? 如果我认为 doc1 是动物,这是真的吗? 有没有办法计算该文档中每个主题的概率以找到文档主导主题? 请问有什么建议吗?
【问题讨论】:
-
如何计算这个数据集中每个主题下的分数?
-
我计算如下:假设文档 x 的句子中包含以下单词 { dog , monkey , bird , cat , spider , cat , donkey , monkey } 那么这个文档的动物主题将变为x 是 8 .. 等等。
标签: text text-mining text-analysis