【问题标题】:Information gain on non discrete dataset非离散数据集的信息增益
【发布时间】:2013-10-12 02:37:03
【问题描述】:

Jiawei Han 的数据挖掘书第 2 版(属性选择测量 - pp 297 到 300)解释了如何计算每个属性(年龄、收入、信用等级)和类别(buys_computer 是或否)实现的信息增益。 在此示例中,每个属性值都是离散的,例如年龄可以是青年/中年/高级,收入可以是高/低/中等,信用评级一般/优秀等。

我想知道如何将相同的信息增益应用于采用非离散数据的属性。例如收入属性采用任何货币金额,如 100.68、120.90 等。 如果有 1000 名学生,则可能有 1000 个不同的金额值。

我们如何在非离散数据上应用相同的信息增益?任何教程/示例示例/视频网址都会有很大帮助。

【问题讨论】:

  • 这是一个很好的问题,但我认为它属于 math.stackexchange.com

标签: machine-learning data-mining


【解决方案1】:

对连续变量 (1d) 进行拆分的最常见方法是选择一个阈值(从一组离散的阈值中选择,或者您可以选择一个先验)。因此,您可以通过首先对其进行排序(您必须有一个顺序)然后扫描它以获得最佳值来计算连续值的信息增益。 http://dilekylmzr.files.wordpress.com/2011/09/data-mining_lecture9.ppt

在随机森林中使用此技术的示例

这种技术通常用于随机森林(或决策树),因此我将在此发布一些资源参考。

更多关于随机森林和这种技术的信息可以在这里找到:http://www.cs.ubc.ca/~nando/540-2013/lectures.html。请参阅 youtube 上的讲座,因为幻灯片信息量不大。讲座中介绍了如何在 Kinect 中使用随机森林匹配身体部位,非常有趣。 您也可以在这里查看:https://research.microsoft.com/pubs/145347/bodypartrecognition.pdf - 讲座中正在讨论的原始论文。

请注意,为了获得信息,您还可以使用高斯熵。它基本上是对拆分前后的数据进行高斯拟合。

【讨论】:

  • 已删除过时的对话。
【解决方案2】:

当您的目标变量是离散的(分类的)时,您只需根据您正在考虑的左/右拆分中类别的经验分布计算熵,并将它们的加权平均值与没有拆分的熵进行比较。

对于像收入这样的连续目标变量,其定义类似于differential entropy。出于您的目的,您将假设集合中的值具有正态分布,并相应地计算微分熵。来自维基百科:

也就是说,它只是值方差的函数。请注意,这是在 nats 中,而不是在熵中。要与上面的香农熵进行比较,您必须进行转换,这只是一个乘法。

【讨论】:

猜你喜欢
  • 2015-07-28
  • 2010-12-27
  • 2011-07-24
  • 2017-06-27
  • 2011-06-01
  • 1970-01-01
  • 2014-10-17
  • 2018-04-12
  • 2018-02-02
相关资源
最近更新 更多