【发布时间】:2014-08-14 11:33:55
【问题描述】:
我鼓励解决下一个问题: 我正在尝试对很多文本文档进行分类。
有 20 类:1 正常,19 - 异常。 当我使用朴素贝叶斯分类时,我得到以下结果:分类适用于 19 个类,但对于“正常”类,我得到了许多错误分类错误:“正常”类别中的几乎所有案例都被归类为其他(非正常)类别。
有我的问题:
- 我应该如何为“正常”类选择训练集? (现在,我刚好适合 对具有“正常”类别的文本分类器集,具有 1/20 比例)。
- 可以这样指定分类器:如果属于的概率
某些类小于某个阈值,则必须设置分类器
此样本的类别(例如正常)?
【问题讨论】:
标签: machine-learning nlp scikit-learn text-classification