【问题标题】:Handling optional data in Logistic regression处理逻辑回归中的可选数据
【发布时间】:2020-08-24 06:47:30
【问题描述】:

我正在处理包含学生分数和其他特征的数据,并试图预测他们是否会在 python 中使用 scikit-learn 获得高薪。我遇到了一个问题, 因为一个学生没有选修所有科目,如果他没有选修该科目,他/她在一个科目的分数是-1(一个学生可以选修多个科目)。

下面是从数据文件中截取的快照: Snapshot

我正试图找到一种方法来解释 -1 的方式不会改变太多的数据。

我的方法:

  1. 取每个学生的百分位数,然后取每个学生所有百分位数的平均值,为每个学生提供一个数字,这更容易使用,但这种方法可能会丢失一些关于分数分布的信息。

  2. 用该学科所有学生的平均分填充 -1 值,但如果数据偏向某一学科,这将不起作用

有没有更好的方法来处理这种数据?

【问题讨论】:

  • 你的问题是什么?
  • 如何以不改变数据的方式解释 -1。
  • 请编辑和更新您的帖子以明确澄清这一点。

标签: python-3.x machine-learning scikit-learn logistic-regression


【解决方案1】:

您的“-1”相当于缺失数据,因此您在询问如何处理缺失数据的分类任务。有关此主题的讨论,请参阅hereherehere 等。

想到的几个重要考虑因素:

  • 一种选择是“估算”缺失值,这就是您使用“平均分”所描述的内容。这种方法通常需要假设数据“随机缺失”,在您的情况下这不太可能是正确的:例如,一个差劲的学生更有可能不学习困难的科目,因此缺失值会告诉您一些事情。

  • 使用回归模型(如逻辑回归)通常需要某种类型的插补。但是还有其他模型,例如决策树或随机森林,可以处理缺失数据而无需插补。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-09-21
    • 2019-03-02
    • 1970-01-01
    • 2016-09-13
    • 1970-01-01
    • 2020-07-05
    • 1970-01-01
    • 2013-08-27
    相关资源
    最近更新 更多