【发布时间】:2016-02-07 00:08:36
【问题描述】:
我正在尝试使用例如逻辑回归或决策树(或任何其他类似方法)在 R 中构建预测模型。除了分类变量(例如是否存在疾病),数据集还包括性别、年龄、BMI、吸烟状况等变量。
变量 sex 对我的模型非常重要,我希望它成为预测变量的一部分。然而,在探索性分析过程中,我意识到超过 2/3 的观察结果来自女性受访者,这并不是女性人口的真实比例。
我该怎么做才能考虑到这一点?我的意思是,我不希望该模型仅仅因为从男性受访者那里获得的观察结果多于观察结果,就给女性带来更大的风险(例如)。
非常感谢。
【问题讨论】:
-
这不是一个特定的编程问题,因此不适合 Stack Overflow。如果您需要有关统计分析的建议,请改为发帖至Cross Validated。
-
应该迁移到CV;但是,您可以使用权重
标签: r classification decision-tree logistic-regression