【问题标题】:Need an interpretation on a statistical expression on missing values需要对缺失值的统计表达式进行解释
【发布时间】:2021-04-18 03:26:30
【问题描述】:

我在网上阅读了一篇关于缺失值的论文,在解释下面以粗体突出显示的第一句话的含义时遇到了问题:

缺少数据会带来各种问题。 首先,数据的缺失会降低统计功效,即当原假设为假时,检验拒绝原假设的概率。其次,丢失的数据会导致参数估计的偏差。第三,它会降低样本的代表性。第四,它可能使研究分析复杂化。这些扭曲中的每一个都可能威胁到试验的有效性,并可能导致无效的结论。

希望听到一些解释。

【问题讨论】:

标签: machine-learning data-science missing-data imputation


【解决方案1】:

首先,功效是在事实上它是错误的时拒绝原假设的概率。所以,你可以说这是做出正确决定的概率。缺乏数据会降低这种统计功效、研究样本量低、正在调查的影响较小,或两者都对统计显着性发现实际上反映真实影响的可能性产生不利影响。这意味着假设您有 100 个样本,并且由于缺失值而从数据集中丢弃了 40 个样本,现在无论您使用剩余的 60 个样本得出什么结论,您都不能确信它反映了真实的效果。

其次,例如,如果您选择使用平均值替换那些缺失值,那么实际上您是在向数据注入一种偏差,但是您决定替换或删除数据时,偏差就会被注入。 (虽然某些偏见在某些情况下更合理)

第三,这句话本身就很有解释性,那些缺失值会降低样本的代表性,因为你没有关于这些样本的所有信息.

最后,我们可以说它(缺失值)实际上确实使我们的研究复杂化,这是我们在处理数据时最不想要的,但是由于人为错误以及许多其他错误来源,我们经常必须通过某些操作来处理这些缺失值。

【讨论】:

    猜你喜欢
    • 2023-02-03
    • 2013-03-23
    • 2011-09-08
    • 1970-01-01
    • 1970-01-01
    • 2021-11-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多