【发布时间】:2019-05-25 13:52:55
【问题描述】:
我正在尝试使用梯度提升机来解决二进制分类问题。
鉴于下表包含 4 列,其中 ColumnA 是我试图预测的二进制值 (0,1)
| ColumnA | ColumnB | ColumnC | ColumnD | ... |
| 0 |
| 1 |
在整个训练数据中,我计算了平均值,发现A为0和1时ColumnB的平均值有很大差异,所以从我的解释来看,这意味着这个值应该起到非常重要的作用在预测中?
但是,当涉及到我试图分类的未来数据时,我没有关于 ColumnB 的任何信息。我的问题是,简单地取 columnB 的平均值并将其作为未来数据的值是否有意义,或者我应该完全删除 ColumnB,因为我无法在未来的值中获取该数据?
目前我认为使用平均值作为默认值是有意义的,但由于这否定了该列在未来预测中的有效性,也许我这样做是徒劳的?
【问题讨论】:
标签: python machine-learning classification