【发布时间】:2018-01-27 03:04:14
【问题描述】:
我在特征工程中研究了 Kaggle 上的填充 null 方法。 一些玩家用另一个对象值填充 NA。
例如,sex 列中有 'Male'、'Female' 和 NA 值。该方法是用另一个对象值填充 NA,例如“Middle”。之后,它会处理不带任何 null 的 sex 属性,pandas 不会找到 null。
我想知道该方法对机器学习模型的性能或良好的特征工程有很好的影响吗? 除此之外,在数据集中没有知识发现的情况下,还有其他好的方法来填充 NA 吗?
【问题讨论】:
-
本博客讨论了一些额外的 NA 插补技术:trainindata.medium.com/…,并且可以使用来自 sklearn (scikit-learn.org/stable/modules/generated/…) 的 SimpleImputer 或使用开源 Python 包 Feature-engine:feature-engine.readthedocs.io/en/latest/imputation/index.html 来实现
标签: machine-learning feature-extraction kaggle sklearn-pandas