【发布时间】:2020-08-24 06:47:30
【问题描述】:
我正在处理包含学生分数和其他特征的数据,并试图预测他们是否会在 python 中使用 scikit-learn 获得高薪。我遇到了一个问题, 因为一个学生没有选修所有科目,如果他没有选修该科目,他/她在一个科目的分数是-1(一个学生可以选修多个科目)。
下面是从数据文件中截取的快照: Snapshot
我正试图找到一种方法来解释 -1 的方式不会改变太多的数据。
我的方法:
-
取每个学生的百分位数,然后取每个学生所有百分位数的平均值,为每个学生提供一个数字,这更容易使用,但这种方法可能会丢失一些关于分数分布的信息。
-
用该学科所有学生的平均分填充 -1 值,但如果数据偏向某一学科,这将不起作用
有没有更好的方法来处理这种数据?
【问题讨论】:
-
你的问题是什么?
-
如何以不改变数据的方式解释 -1。
-
请编辑和更新您的帖子以明确澄清这一点。
标签: python-3.x machine-learning scikit-learn logistic-regression