【发布时间】:2015-09-18 12:34:44
【问题描述】:
我正在分析一个包含 15 个变量和 150 万个数据点的医学数据集。 我想预测住院情况,更重要的是预测可能是哪种药物。 药物变量有大约 700 种药物。 有谁知道如何计算“价值”(在这种情况下是药物类型)在变量中的重要性以用于提升? 我需要知道“药物 A”是否是在称为“药物”的变量中,预测都比“药物 B”更好。 逻辑回归模型能够根据每种药物的 p 值提供此类信息,但我想使用更复杂的方法。当然,您可以为每种类型的药物创建一个二元变量,但这会提供 700 个额外变量,而且似乎效果不佳。我目前正在使用 r。我真的希望你能帮我解决这个问题。提前致谢!亲切的问候彼得
【问题讨论】:
-
我试图通过一个例子和提升来缩小它。
标签: r variables machine-learning neural-network random-forest