【发布时间】:2016-05-13 00:33:00
【问题描述】:
我使用 ML 方法使用 python scikit-learn 进行研究。我发现 SVM 和逻辑回归分类器效果最好(例如:85% 的准确率),决策树的效果明显较差 (65%),然后朴素贝叶斯的效果明显较差 (40%)。
我将写出结论来说明一些 ML 分类器明显优于其他分类器,但基于这些观察,我还能对我的学习任务或数据结构说些什么呢?
版本:
数据集涉及 500,000 行,我有 15 个特征,但其中一些特征是某些文本的子字符串的各种组合,因此它作为稀疏矩阵自然扩展到数万列。我使用人名来预测一些二进制类(例如:性别),尽管我从名称实体中进行了很多特征工程,例如名称的长度、名称的子字符串等。
【问题讨论】:
-
我希望您调整所有尝试过的分类器的参数,尤其是决策树分类器。你能更详细地描述一下你的数据集吗?
-
是的,我在调优的时候确实尝试了很多参数。数据集涉及 500,000 行,我有 15 个特征,但其中一些特征是某些文本的子字符串的各种组合,因此它作为稀疏矩阵自然扩展到数万列。我确实了解不同的 ML 通常如何适合不同大小的行和列,但是如果您对它们都进行了测试并得到不同的结果,我想知道还能推导出什么其他结论。
标签: machine-learning scikit-learn classification prediction