【发布时间】:2022-01-19 06:37:36
【问题描述】:
我正在研究An Introduction to Statistical Learning with Application in R 的第三章,它讨论了分类模型。在第 4.7.3 节线性判别分析(实验室)中,该模型应用于名为 Smarket 的数据集,以预测股市的涨跌。这里上下预测的总数是由以下代码行完成的:sum(lda.pred$posterior[, 1]>= .5) 和 sum(lda.pred$posterior[, 1] < .5),作者写道
注意模型输出的后验概率对应于 市场下跌的概率
然后验证这行代码是写的:
lda.pred$posterior [1:20 , 1]
这给了 posterior probability of 20 observations 和
lda.class [1:20]
这给了classes corresponding to the probabilities of the observations given above
还有当我写这行代码时(感谢 ISLR 在线课程):
data.frame(lda.pred)[1:20, ]
给出classes and corresponding probabilites。可以看出,概率 = 0.5 的观测值被归类为上类。
这一切让我有点困惑。我的问题是in the first case 我们怎么知道当概率大于或等于 0.5 时预测会下降?因为使用contrast() 函数可以看出,R 创建了一个虚拟变量,其中 1 表示向上,这意味着该值对应于市场上涨的概率,而不是下跌的概率。再次in the second case 为什么概率 >= 0.5 的观察被归类为向上?第一种情况和第二种情况不矛盾吗?
【问题讨论】:
标签: r machine-learning