【发布时间】:2022-01-02 07:02:05
【问题描述】:
我有一个包含大约 37 个特征的疾病数据集,除了“Age”和“Age_onset”两个之外,它们都是分类变量。条目数为 219。 我正在开发一个二元分类模型来预测患者是否患有这种疾病。
我目前面临的问题是根据数据的分类性质和数量决定选择什么合适的模型。
现在分类变量不是高基数,即使在应用 one-hot 编码后,变量的数量也从 37 个增加到 81 个,因此它仍然被认为是低维数。因此不需要特征选择方法。
此外,数据在条目数(219)和维度(81)方面并不大,因此无需使用神经网络或集成方法等复杂模型。 这排除了大量模型,到目前为止,我认为最好的候选者是 Logistic 回归分类模型。
我的问题:这种推理方式有效吗?还是我应该尝试使用复杂的模型,通过反复试验,我可以在性能和结果方面达到最佳模型?
我已经阅读了许多关于在分类问题中处理分类数据的文章和论文,但是,我的数据不包含连续变量(两个除外),并且基数不高,这意味着所有分类变量都有两个或三个可能的答案(应用 one-hot 编码后的特征数量突出显示为 81)。所以我不确定这些文章中讨论的解决方案是否适用于我的问题。
【问题讨论】:
标签: python scikit-learn classification prediction categorical-data