【问题标题】:Overfitting despite of Missing value, Tree Based Learing尽管存在缺失值,但过拟合,基于树的学习
【发布时间】:2018-07-26 16:49:54
【问题描述】:

我和我的同学们,我们正在开展一个教育机器学习项目,我们遇到了一个过度拟合问题,因为我们对数据挖掘非常缺乏经验。

我们的业务案例是关于零售银行业务,我们的目标是根据产品搜索目标客户群。向客户推荐基于已购买产品的特定产品,如股票、基金、存款等。

我们收到了一个包含大约 400 个特征和 150.000 条数据记录的数据集。我们在 Knime 中构建我们的工作流程。我们的工作流程包括以下步骤:

  • 我们探索了数据并定义了目标变量
  • 我们使用了缺失值列过滤器,以消除所有大部分缺失值的列
  • 我们还应用了 Tree Ensemble 工作流程来减少维度

总而言之,我们清理了数据并将其从 400 个变量减少到大约 50 个。 对于建模,我们使用一个简单的决策树 - 问题出现了:这棵树总是给出 100% 的准确度 - 所以我们假设它是高度过度拟合的。

我们做错了什么吗?或者我们应该关注什么?

我们希望社区可以为我们提供一些提示或技巧。

编辑: 是否有任何资料、论文等如何在数据挖掘工具中应用交叉销售,例如刀?我们已经用谷歌搜索过了,但到目前为止我们没有成功。

【问题讨论】:

  • 你分成训练集/测试集了吗?有什么方法可以限制树的深度吗? (只是引发思考的头顶式问题!)
  • 嘿 SteveR 是的,我们分成了 80/20 的训练和测试集。好的,我们会跟进这一点,谢谢。
  • 我编辑了我的问题你有什么想法吗??
  • @Stelios 你的测试准确度是多少?
  • 你检查过实际的树和混淆矩阵吗?你试过交叉验证吗? KNIME 是一个很好的工具,但您可能想尝试使用 Weka 之类的工具来对数据进行初始传递,因为(至少对于决策树而言)它应该为您提供一些合理的默认设置。如果您在 Weka 中获得的内容看起来正确,请尝试在 KNIME 中重现它。

标签: machine-learning decision-tree recommendation-engine knime recommender-systems


【解决方案1】:

决策树的一个问题是它们容易过拟合。你可以 进行剪枝以降低模型的复杂性,从而通过减少过度拟合来提高预测精度,还可以尝试调整 Min-sample-per-leaf、Maximum tree depth

【讨论】:

    【解决方案2】:

    同意前面的评论:DT 的主要优点是过拟合。

    1. 尽量让决策树更简单(至少减少深度)
    2. 使用集成方法(随机森林甚至 XGBoost)。它们是下一代 DT。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2023-03-26
      • 2013-12-28
      • 2020-06-19
      • 1970-01-01
      • 1970-01-01
      • 2018-08-16
      • 1970-01-01
      • 2015-06-30
      相关资源
      最近更新 更多