【发布时间】:2017-05-27 05:07:08
【问题描述】:
我有一个包含 x 属性和 y 记录的数据集。给定一个包含最多 x-1 个缺失值的输入记录,我将如何合理地近似剩余的缺失值之一?
因此,在下面的示例中,输入记录有两个值(属性 2 和 6,其余部分缺失),我想近似属性 8 的值。
我知道缺失值是通过“插补”处理的,但我通常会找到有关预处理数据集的示例。我正在寻找一种解决方案,它使用回归来确定缺失值,并在理想情况下使用构建一次的模型(如果可能,不必每次都生成一个)。
【问题讨论】:
-
如果您以文本而不是图像的形式提供示例数据,将会很有帮助。我们无法剪切和粘贴图像。
标签: machine-learning classification regression imputation