【发布时间】:2015-10-23 17:03:14
【问题描述】:
提前感谢您的帮助。
我正在尝试在包含大约 10000 个样本的数据集上训练二元分类器。该数据集不平衡,两个类别之间的比率约为 1:9。我想增加较低出现类的错误分类成本,但无论我使用什么方法,也不管我使用什么成本矩阵,我都会得到相同的结果(基本上是 zeroR 模型的输出)。当使用逻辑回归时,我希望至少看到不同成本矩阵的一些差异,但事实并非如此。我正在使用 weka 3-7-11。我注意到只有 libLinear(不是股票分类器)给出的预测与 zeroR 显着不同。我没有注意到 libSVM 的这一点。这对我来说似乎很奇怪。可能会发生什么?
【问题讨论】:
-
坦白说? Weka 可能会声明它具有该功能,但可能无法实现。我有点讨厌这个工具 - 我不得不经常使用它,而且我已经阅读了很多它的源代码,它充满了未使用的变量、空的 catch 块等。
-
有可能,但我不这么认为。我以前用过。尽管关于实施,我同意你的看法。我通常使用 matlab 或 R。不过,weka 非常适合快速而肮脏的方法。
标签: machine-learning classification weka