【问题标题】:Missing Value in Data Analysis数据分析中的缺失值
【发布时间】:2016-06-11 08:43:00
【问题描述】:

我有一个数据集,其中包含两个级别 Male(M) 和 Female(F) 的变量 GENDER 有很多缺失值。我如何处理缺失值?处理这些缺失值的不同方法是什么。任何帮助将不胜感激。

【问题讨论】:

  • 你的意思是null by missing values
  • 是的。我的意思是根本没有条目..没有 F 没有 M 只是空白..
  • 性别

标签: machine-learning missing-data data-analysis method-missing


【解决方案1】:

有几种技术可以估计缺失值。我一直在为 Uni 的一个项目写一篇关于这些方法的论文。
我将简要解释 5 种常用的缺失数据插补技术。在下文中,我们将考虑一个数据集,其中每一行都是一个模式(或观察),每一列都是一个特征(或属性),假设我们要“修复”一个在其 j 中有缺失值的给定模式-第特征(位置)。

  • 模式去除。
    如果该模式至少有一个缺失值,则从数据集中删除该模式。
    但是,如果存在大量缺失值的模式,我不建议使用这种方法,因为您的数据集中的模式数量会急剧减少,而且训练阶段也不会减弱。
  • 均值/众数方法。
    如果模式在位置 j 有缺失值,则取平均值(如果 j-th 属性是连续的)或模式(如果 j-th 属性是分类的)第 j 列,并在模式的第 j 位置替换这种均值/众数。显然,在平均值/模式评估中,您应该只考虑列 j 中的非缺失值。
  • 条件均值/众数。
    如果您有标签(即监督学习),则可以考虑以前的方法,但在均值/模式评估中,仅考虑列 j 中属于模式的(非缺失)元素与您尝试修复的模式具有相同的标签。这实质上改进了之前的方法,因为您不考虑属于不同类的模式的值。
  • 热甲板。
    给定一个特定的差异度量,您可以测量要修复的模式与要估算的属性中没有缺失值的所有其他模式之间的差异(在我们的例子中是 j-th 属性) .从最相似的模式中取出第 j 个特征并将其替换回要修复的模式的第 j 个位置。
  • K-最近邻。
    这类似于 Hot-decking,但不考虑最相似的模式,您可以考虑在我们的第 j 个特征中没有缺失值的 K 个最相似的模式。然后考虑这些 K 模式的第 j 个特征中最常见的项目(模式)。

K-Nearest Neighbors 的 K 值可以通过交叉验证找到,可以先验设置,也可以使用经验法则值 (K em> = 实例数的平方根)。

差异度量实际上取决于您,但常见的选择是 HEOM(异构欧几里得重叠度量),可以在 here(第 2.3 节)中找到。这种差异度量在具有大量缺失值的数据集中非常有效,因为它也允许您处理具有缺失值的模式(显然 不是 在您要估计的特征中)。
丢弃要估算的特征中缺失值的模式确实很重要:如果您的相异性度量返回了特征 j 中也缺失值的最相似的模式,那么您基本上是在替换缺失值带有另一个缺失值。无意义。此示例适用于 Hot-decking,但您甚至可以将此类概念扩展到 K-最近邻中的 K 个最相似的模式(即 中最常见的项目的不幸情况K 个最相似模式的第 j 个特征也是缺失值)。

【讨论】:

    【解决方案2】:

    这在很大程度上取决于具体情况。但是,一些通用的方法是:

    1. 删除部分数据缺失的行。

    2. Imputing missing values。基本上,您可以将性别列视为您必须预测的内容(可能使用其他列)。使用具有所有值的行训练您的预测器,并预测缺失的行。

    3. 创建第三类“缺失”,让机器学习算法处理。

    【讨论】:

    • 这与您最初提出的问题有些不同,不是吗?我建议你单独问,并确保给它“r”标签。
    猜你喜欢
    • 1970-01-01
    • 2018-02-17
    • 2020-08-22
    • 2017-09-10
    • 2021-09-14
    • 2020-06-17
    • 2011-02-19
    • 2020-12-22
    • 1970-01-01
    相关资源
    最近更新 更多