【问题标题】:Machine Learning - Decision Tree - splitting feature value机器学习 - 决策树 - 分割特征值
【发布时间】:2015-12-11 02:09:49
【问题描述】:

我有一个关于拆分节点的问题。我有 4 个功能,想预测这个人是否会玩,可能玩或不玩。基于信息增益,我将天气作为第一个拆分的特征,其中给出了雨、热和湿作为分支。下雨导致纯粹的“是”预测。炎热和潮湿没有。我正在尝试确定接下来应该选择哪个特征值(热或湿?)来增长/拆分。我知道我可以根据最大信息增益选择下一个特征。具有最大信息增益的下一个特征是性别。但是我不知道我应该使用Hot来进一步下降还是使用Humid?

               Weather  
Rainy            Hot             Humid
Yes                     


Gender  YoungOrOld  Weather Mood    Play?
Male    0           Hot     Bad     Yes
Male    1           Hot     OK      Yes
Female  1           Hot     OK      Maybe
Female  0           Hot     Bad     Yes
Male    1           Hot     OK      Yes
Male    0           Humid   OK      Yes
Female  1           Humid   OK      Maybe
Female  1           Rainy   Good    No
Male    2           Rainy   OK      No
Female  2           Rainy   Good    No

【问题讨论】:

    标签: machine-learning decision-tree


    【解决方案1】:

    你已经在天气和性别上产生了分歧。 天气 == 下雨不再需要分裂 别的 性别 = 男性不再需要分裂

    您建议的拆分是 Hot vs Humid,但这没有任何好处。相反,在 YoungOrOld 上分裂。两个女性“1”条目是可能;其他人都是Yes。 现在所有节点都是纯的。

    【讨论】:

      【解决方案2】:

      您已按特征“天气”划分数据集的样本,现在您看到当节点中的“天气=下雨”样本是纯样本时,因此您不必从此处拆分此节点,这与其他非“Weather=Hot”或“Weather=Humid”的纯节点。由于杂质,默认情况下您应该将它们分开。但是你可以指定你自己的停止标准,除了纯节点时停止,你可以指定分裂一个节点所需的最小样本数,然后不仅在纯节点时停止分裂,而且当节点太少时停止分裂节点中的样本进行拆分。

      【讨论】:

        猜你喜欢
        • 2013-04-21
        • 2015-12-13
        • 1970-01-01
        • 2013-01-07
        • 1970-01-01
        • 2011-01-29
        • 2012-12-31
        • 2018-05-15
        • 2021-07-06
        相关资源
        最近更新 更多