【发布时间】:2016-01-20 07:17:14
【问题描述】:
我有 2 个输出类(好和差)基于几个数字特征(例如 v1….v20)。
如果 v1、v2、v3 和 v4 为“高”,则该类为“差”。 如果 v1、v2、v3 和 v4 为“低”,则该类为“好”
使用 ROC 和使用随机森林的最小分类错误,我能够获得这样的良好准确性。 但是,我想添加一个新变量 v21。我从经验中知道,如果这个变量(v21)的值很高,那么即使 v1、v2、v3 和 v4 很高,这个类也可能不是“差”的。当变量 v21 很高时(尽管变量 v1、v2、v3 和 v4 很高),获得“差”类的概率很低。
1)如何在分类中使用我对v21的知识来提高准确率?哪种分类技术是合适的? 2)由于我有符合我理解的真实数据,无论如何,当v21的值很高并且v1,v2,v3和v4的值很高时,我可以计算得到“差”类的概率吗?
【问题讨论】:
-
你目前使用什么算法来判断好坏?
-
我目前在 R 中使用随机森林
标签: machine-learning classification probability