【问题标题】:Classification documents based on topic frequency基于主题频率的分类文档
【发布时间】:2016-02-09 09:36:59
【问题描述】:

我需要一种方法来澄清以下数据集的主导主题,以下数据集是在预处理所有文档后产生的,
以下选定的主题频率如下:

                                         TOPICS 
id   Doc-name   total words     Politics    sport    food   animals  
1       doc1        1000          300         250     100     350
2       doc2        2000          1000        400     200     400
3       doc3        4000          500         300     2000    200
etc... 

问题是: 这种数据集有什么分类方法吗? 如果我认为 doc1 是动物,这是真的吗? 有没有办法计算该文档中每个主题的概率以找到文档主导主题? 请问有什么建议吗?

【问题讨论】:

  • 如何计算这个数据集中每个主题下的分数?
  • 我计算如下:假设文档 x 的句子中包含以下单词 { dog , monkey , bird , cat , spider , cat , donkey , monkey } 那么这个文档的动物主题将变为x 是 8 .. 等等。

标签: text text-mining text-analysis


【解决方案1】:

这种分类方法只有在应该确定与给定主题相关的文档类型时才有用。这种类型的分析绝不会让人了解它写博客的真实背景。

如果我说“运动员肯定比任何猫、狗、牛或羊都快”,这句话的上下文是什么?它是关于动物的吗?

通过这种类型的分析,您可以对句子的上下文做出的唯一结论是“句子有导致描述运动和动物的因素。这些因素的参与是 4 到 2 ”。

您可以继续使用标准方法计算概率。但这些数字与真实背景的相关性可能很遥远。

【讨论】:

  • 感谢解释,这种概率的计算方法是什么?
  • 您可以在此处计算的概率是随机词属于特定主题的机会。假设您在文档中有 5 个动物词和 3 个政治词。所以任何单词变成动物的概率是 5 / (5+3)。正如我所说,您永远无法通过这种方法准确暗示文章的真实上下文。但是,同样,在实际情况下,任何包含 600 个政治词的随机文章(其中 100 个是真正的政治文章)都会有所不同。只是没有任何保证。在这种情况下,您可以考虑简单多数。
  • 谢谢,你能计算一下我的第一个实例的概率吗?
  • 请您详细说明一下。
  • 对于我的表,我想计算政治、运动、食物、动物的概率?如何计算每个主题的概率,那么有没有一种方法可以更有效地根据{常用词或主题}对每个文档进行分类谢谢
猜你喜欢
  • 2023-03-08
  • 2018-12-30
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2019-09-24
  • 2017-02-01
  • 2021-11-20
相关资源
最近更新 更多