【发布时间】:2019-02-22 19:15:50
【问题描述】:
我的数据包含大量 x 变量,这些变量主要是分类/名义变量,而我的目标变量是多类标签。我能够建立几个模型来预测多类变量并比较它们的表现。我有训练和测试数据。训练和测试数据都给了我很好的结果。
现在,我试图找出模型预测某个 Y 变量的“原因”?意思是如果我有天气数据:X 变量:城市、州、邮政编码、温度、年份; Y 变量:雨、太阳、多云、雪。我想找出模型预测的“原因”:雨、太阳、多云或雪。我使用了多项式、决策树等分类算法
这可能是一个广泛的问题,但我需要一个可以开始研究的地方。我可以预测“什么”,但看不到“为什么”它被预测为雨、太阳、多云或雪标签。基本上,我试图找到导致预测变量的变量之间的联系。
到目前为止,我一直在考虑使用相关矩阵、主成分分析(在模型构建过程中发生)……至少看看哪些是好的预测变量,哪些不是。有没有办法找出“为什么”的因素?
【问题讨论】:
标签: machine-learning data-science