【发布时间】:2017-03-23 03:28:29
【问题描述】:
给定一个包含短语的数据库
例子:
检查工作缓慢
工作壁纸
工作需要回复通知工作组
我需要计算每个不同单词的信息增益。
- IG('工作')
- IG('检查')
- ....
我研究了熵和信息增益的概念,但我不确定如何在短语中应用它。 我看到了这个链接:https://mariuszprzydatek.com/2014/10/31/measuring-entropy-data-disorder-and-information-gain/ 但就我而言,我没有短语类别。 我需要知道仅给出短语的哪些单词具有最大的信息增益。
【问题讨论】:
-
我认为这更适合 CrossValidated,而不是 StackOverflow。
-
您首先需要为每个句子设置一个值,然后才能弄清楚每个单词可以给您多少。你需要更多的三个句子。训练集太小了
-
谢谢。我的集合有 30000 个短语,这是一个简单的例子,可以更好地解释。你如何为每个句子定义一个值?手动?
-
你通常会发现一组数据特征的信息增益。我假设您正在使用这些单词作为句子的特征。要找到一个特征(或者在你的情况下是一个词)的信息增益,你需要数据集的总值。您可以将句子的值定义为二进制,即“做这个”或“不做这个”,它可能意味着做某事的程度,即从 1 到 10。这取决于句子的内容意思
-
谢谢巴兹。最佳