【发布时间】:2015-11-11 17:03:27
【问题描述】:
我正在使用 R 中插入符号库中的 confusionMatrix 函数来评估两种方法的性能,例如(来自 glmnet 库的弹性网络、来自 kernlib 的高斯处理器、随机森林)在两个类上数据。
我有时可以看到一些方法,我得到了
警告信息:在confusionMatrix.default(pred, truth) 中:参考和数据的级别顺序不同。将数据重构为 匹配。
并且性能是例如 65%;但是,如果我根据“真相”重新标记预测(在上面的示例中为 pred)的级别(更改顺序);性能变为 25%。
我构建了以下玩具数据。
pred = c("a", "a", "a", "b")
pred = as.factor(pred)
levels(pred) = rev(levels(pred)) % given this line, I can either get 25% or 75%.
truth = c("a", "a", "b", "b")
truth = as.factor(truth)
confusionMatrix(pred, truth)
我理解它是直观的,因为它是一个两类数据。但是,我想知道,我这样做是否对我有利;意思是如果性能是 25%(简单地说,接受它为 75%)。
【问题讨论】:
标签: r classification r-caret glmnet kernlab