【问题标题】:How can r-squared be negative when the correlation between prediction and truth is positive?当预测与事实之间的相关性为正时,r-squared 如何为负?
【发布时间】:2020-07-12 13:47:28
【问题描述】:

试图了解 r 平方(以及解释方差)指标如何可能为负(因此表明不存在预测能力),同时预测与真实之间的相关因子(以及线性斜率) -regression(回归预测的真相))是积极的

【问题讨论】:

    标签: statistics data-science


    【解决方案1】:

    R Squared 在极少数情况下可能为负数。

    R 平方 = 1 – (SSR/SST)

    在这里,SST 代表总平方和,它只是预测点与目标变量的平均值有多少不同。平均值在这里只不过是一条回归线。

    SST = Sum(平方(每个数据点 - 目标变量的均值))

    例如,

    如果我们想建立一个回归模型以体重作为自变量来预测学生的身高,那么一个可能的预测不费吹灰之力就是计算所有当前学生的平均身高并将其视为预测。

    在上图中,红线是回归线,它只是所有高度的平均值。该平均值计算不费力,可以被认为是最差的预测方法之一,准确性较差。在图表本身中,我们可以看到预测与原始数据点相差甚远。 现在来SSR,

    SSR 代表残差平方和。该残差是根据我们根据数学方法(线性回归、贝叶斯回归、多项式回归或任何其他方法)构建的模型计算得出的。如果我们使用复杂的方法而不是使用像 mean 这样的幼稚方法,那么我们的准确性会明显提高。

    SSR = Sum(平方(每个数据点 - 回归线中的每个对应数据点))

    在上图中,让我们认为蓝线表示具有大量数学分析的复杂模型。我们可以看到它的准确率明显高于红线。

    现在来公式,

    R 平方 = 1- (SSR/SST)

    这里,

    • SST 会很大,因为它是一个非常差的模型(红线)。
    • SSR 将是一个小数字,因为它是我们开发的最佳模型 经过大量数学分析(蓝线)。
    • 所以,SSR/SST 将是一个非常小的数字(它会变得非常小 每当 SSR 降低时)。
    • 因此,1- (SSR/SST) 将是一个很大的数字。
    • 因此我们可以推断,每当 R 平方上升时,这意味着 模型太好了。

    这是一种通用情况,但不能应用于存在多个自变量的许多情况。在示例中,我们只有一个自变量和一个目标变量,但在实际情况下,我们将有 100 个自变量用于单个因变量。实际的问题是,在 100 个自变量中-

    • 某些变量与目标变量的相关性非常高。
    • 某些变量与目标变量的相关性非常小。
    • 还有一些自变量根本没有相关性。

    因此,RSquared 是在假设目标的平均线(即 y 轴的垂直线)是模型在最大风险情况下可能具有的最差拟合的假设下计算的。 SST 是这条平均线与原始数据点之间的平方差。同样,SSR 是预测数据点(按模型平面)与原始数据点之间的平方差。

    SSR/SST 给出了 SSR 相对于 SST 最差的比率。 如果您的模型可以在某种程度上构建一个比最差的飞机相对好,那么在 99% 的情况下 SSR

    但是如果 SSR>SST 呢?这意味着您的回归平面比平均线 (SST) 差。在这种情况下,R 平方显然是负数。但它只发生在 1% 或更少的案例中。

    答案最初是我在quora中写的-

    1. https://qr.ae/pNsLU8
    2. https://qr.ae/pNsLUr

    【讨论】:

      猜你喜欢
      • 2022-01-07
      • 2023-01-03
      • 1970-01-01
      • 2019-12-11
      • 2014-08-08
      • 2022-01-26
      • 1970-01-01
      • 1970-01-01
      • 2023-03-27
      相关资源
      最近更新 更多