【问题标题】:How calculate information gain of a word given a set of text?给定一组文本,如何计算单词的信息增益?
【发布时间】:2017-03-23 03:28:29
【问题描述】:

给定一个包含短语的数据库

例子:

  1. 检查工作缓慢

  2. 工作壁纸

  3. 工作需要回复通知工作组

我需要计算每个不同单词的信息增益。

  1. IG('工作')
  2. IG('检查')
  3. ....

我研究了熵和信息增益的概念,但我不确定如何在短语中应用它。 我看到了这个链接:https://mariuszprzydatek.com/2014/10/31/measuring-entropy-data-disorder-and-information-gain/ 但就我而言,我没有短语类别。 我需要知道仅给出短语的哪些单词具有最大的信息增益。

【问题讨论】:

  • 我认为这更适合 CrossValidated,而不是 StackOverflow。
  • 您首先需要为每个句子设置一个值,然后才能弄清楚每个单词可以给您多少。你需要更多的三个句子。训练集太小了
  • 谢谢。我的集合有 30000 个短语,这是一个简单的例子,可以更好地解释。你如何为每个句子定义一个值?手动?
  • 你通常会发现一组数据特征的信息增益。我假设您正在使用这些单词作为句子的特征。要找到一个特征(或者在你的情况下是一个词)的信息增益,你需要数据集的总值。您可以将句子的值定义为二进制,即“做这个”或“不做这个”,它可能意味着做某事的程度,即从 1 到 10。这取决于句子的内容意思
  • 谢谢巴兹。最佳

标签: python machine-learning


【解决方案1】:

搜索术语 tf-idf
阅读这个问题,你的术语 set of text == document

interpreting-the-sum-of-tf-idf-scores-of-words-across-documents

【讨论】:

    猜你喜欢
    • 2014-10-17
    • 2018-03-26
    • 2019-04-29
    • 2016-09-09
    • 2015-07-28
    • 1970-01-01
    • 1970-01-01
    • 2010-12-27
    • 2011-07-24
    相关资源
    最近更新 更多