【发布时间】:2019-04-10 14:44:55
【问题描述】:
我正在研究决策树模型。数据集与汽车有关。我在训练集中有 80% 的数据,在测试集中有 20% 的数据。模型的摘要(基于训练数据)显示错误分类率约为 0.02605,而当我在训练集上运行模型时为 0.0289,它们之间的差异约为 0.003。差异是否可以接受,是什么导致了这种差异?我是 R/statistics 的新手。请分享您的反馈。
【问题讨论】:
标签: r statistics decision-tree
我正在研究决策树模型。数据集与汽车有关。我在训练集中有 80% 的数据,在测试集中有 20% 的数据。模型的摘要(基于训练数据)显示错误分类率约为 0.02605,而当我在训练集上运行模型时为 0.0289,它们之间的差异约为 0.003。差异是否可以接受,是什么导致了这种差异?我是 R/statistics 的新手。请分享您的反馈。
【问题讨论】:
标签: r statistics decision-tree
可接受的错误分类率更像是艺术而非科学。如果您的数据是从单个总体生成的,那么毫无疑问,组之间会出现一些不可避免的重叠,这将使线性分类容易出错。这并不意味着它有问题。例如,如果您将信用卡费用归类为可能是欺诈性的,并且在您将观察归类为前者的情况下您的追索权并不太苛刻,那么您可能有利于更安全的一面并结束更多的误报而不是低误分类率。您可以 1. 可视化您的数据以识别重叠,或 2. 计算 N*.03 以识别错误分类案例的数量;如果您了解您要分类的内容,您可以通过这种方式评估错误分类的严重性。
【讨论】: