【问题标题】:Predictive model (classification) with biased data带有偏差数据的预测模型(分类)
【发布时间】:2016-02-07 00:08:36
【问题描述】:

我正在尝试使用例如逻辑回归或决策树(或任何其他类似方法)在 R 中构建预测模型。除了分类变量(例如是否存在疾病),数据集还包括性别、年龄、BMI、吸烟状况等变量。

变量 sex 对我的模型非常重要,我希望它成为预测变量的一部分。然而,在探索性分析过程中,我意识到超过 2/3 的观察结果来自女性受访者,这并不是女性人口的真实比例。

我该怎么做才能考虑到这一点?我的意思是,我不希望该模型仅仅因为从男性受访者那里获得的观察结果多于观察结果,就给女性带来更大的风险(例如)。

非常感谢。

【问题讨论】:

  • 这不是一个特定的编程问题,因此不适合 Stack Overflow。如果您需要有关统计分析的建议,请改为发帖至Cross Validated
  • 应该迁移到CV;但是,您可以使用权重

标签: r classification decision-tree logistic-regression


【解决方案1】:

这里有一个很好的讨论:https://stats.stackexchange.com/questions/6067/does-an-unbalanced-sample-matter-when-doing-logistic-regression。这更像是一个统计问题而不是 R 问题。简短的回答是它不应该是一个问题。请注意底部的最终答案,它说您可以自己平衡样本,然后记住您的模型是假设类同样常见的后验概率估计。在这种情况下,您实际上可以这样做,这将是一个准确的假设,因为您知道人口中男性和女性的真实比例。假设您有足够的数据,您可以随机删除一半的女性观察结果。你也可以修补一下。我经常发现了解某事是否有效的最佳方法是尝试两种方式,看看它是否有所作为。

【讨论】:

    猜你喜欢
    • 2015-10-22
    • 2014-03-07
    • 2020-09-24
    • 2015-08-13
    • 2015-11-18
    • 2020-05-31
    • 2015-06-21
    • 2016-06-22
    • 2017-10-17
    相关资源
    最近更新 更多