【问题标题】:Is there a way to create multiple regression outputs for a list of dependent variables to one independent variable?有没有办法为一个自变量的因变量列表创建多个回归输出?
【发布时间】:2020-08-11 00:58:37
【问题描述】:

我有一个包含大约 500 只股票及其回报的数据集。我想知道是否有一种方法可以为因变量与一个独立变量生成多个回归输出,即 1 对 1 的关系?

例如,以下是其中一只股票 MSFT 与市场相比的简单回归输出。有没有办法将 500 个变量中的每一个变量放入公式的 Y 分量并为每个变量生成一个新的输出,而不是像下面创建多行那样?甚至可以将所有这些数据放在一张表中?

这些是我试图分组以简化我的流程的变量:

regression_model <- lm(raw_data$MSFT~raw_data$VFINX, raw_data)
summary(regression_model)

【问题讨论】:

标签: r regression lm


【解决方案1】:

对此的一种方法(肯定是某个地方的重复答案?)是:

  • 将数据重塑为长格式
  • 嵌套数据以创建包含独立值和依赖值的小标题列
  • 运行每个回归并将结果存储在新列中
  • 整理回归输出并取消嵌套数据

您的示例数据不可用,所以让我们使用mtcars。假设我们要使用 disphpdratwtqsec 中的每一个来预测 mpg。首先我们选择、收集和嵌套:

library(dplyr)
library(tidyr)
library(purrr)
library(broom)

mtcars %>% 
  select(mpg, disp, hp, drat, wt, qsec) %>% 
  gather(Var, Val, -mpg) %>% 
  nest(data = c(mpg, Val))

结果:

# A tibble: 5 x 2
  Var   data             
  <chr> <list>           
1 disp  <tibble [32 x 2]>
2 hp    <tibble [32 x 2]>
3 drat  <tibble [32 x 2]>
4 wt    <tibble [32 x 2]>
5 qsec  <tibble [32 x 2]>

现在我们可以map每一行进行一次回归,并创建整理输出的列:

mtcars %>% 
  select(mpg, disp, hp, drat, wt, qsec) %>% 
  gather(Var, Val, -mpg) %>% 
  nest(data = c(mpg, Val)) %>% 
  mutate(model = map(data, ~lm(mpg ~ Val, data = .)),
         tidied = map(model, tidy))

# A tibble: 5 x 4
  Var   data              model  tidied          
  <chr> <list>            <list> <list>          
1 disp  <tibble [32 x 2]> <lm>   <tibble [2 x 5]>
2 hp    <tibble [32 x 2]> <lm>   <tibble [2 x 5]>
3 drat  <tibble [32 x 2]> <lm>   <tibble [2 x 5]>
4 wt    <tibble [32 x 2]> <lm>   <tibble [2 x 5]>
5 qsec  <tibble [32 x 2]> <lm>   <tibble [2 x 5]>

最后,选择我们想要的列和unnest

mtcars %>% 
  select(mpg, disp, hp, drat, wt, qsec) %>% 
  gather(Var, Val, -mpg) %>% 
  nest(data = c(mpg, Val)) %>% 
  mutate(model = map(data, ~lm(mpg ~ Val, data = .)),
         tidied = map(model, tidy)) %>% 
  select(-model, -data) %>% 
  unnest(cols = c(tidied))

结果:

# A tibble: 10 x 6
   Var   term        estimate std.error statistic  p.value
   <chr> <chr>          <dbl>     <dbl>     <dbl>    <dbl>
 1 disp  (Intercept)  29.6      1.23       24.1   3.58e-21
 2 disp  Val          -0.0412   0.00471    -8.75  9.38e-10
 3 hp    (Intercept)  30.1      1.63       18.4   6.64e-18
 4 hp    Val          -0.0682   0.0101     -6.74  1.79e- 7
 5 drat  (Intercept)  -7.52     5.48       -1.37  1.80e- 1
 6 drat  Val           7.68     1.51        5.10  1.78e- 5
 7 wt    (Intercept)  37.3      1.88       19.9   8.24e-19
 8 wt    Val          -5.34     0.559      -9.56  1.29e-10
 9 qsec  (Intercept)  -5.11    10.0        -0.510 6.14e- 1
10 qsec  Val           1.41     0.559       2.53  1.71e- 2

您可以从 dplyr::filter() 添加过滤器,例如删除截距行,或选择 p 值阈值。

mtcars %>% 
  select(mpg, disp, hp, drat, wt, qsec) %>% 
  gather(Var, Val, -mpg) %>% 
  nest(data = c(mpg, Val)) %>% 
  mutate(model = map(data, ~lm(mpg ~ Val, data = .)),
         tidied = map(model, tidy)) %>% 
  select(-model, -data) %>% 
  unnest(cols = c(tidied)) %>% 
  filter(p.value < 0.01,
         term != "(Intercept)")

# A tibble: 5 x 6
  Var   term  estimate std.error statistic  p.value
  <chr> <chr>    <dbl>     <dbl>     <dbl>    <dbl>
1 disp  Val    -0.0412   0.00471     -8.75 9.38e-10
2 hp    Val    -0.0682   0.0101      -6.74 1.79e- 7
3 drat  Val     7.68     1.51         5.10 1.78e- 5
4 wt    Val    -5.34     0.559       -9.56 1.29e-10

【讨论】:

  • 我认为我在嵌套步骤中迷路了。 5x2 tibble 中的数据是否与其他每个变量(disp、hp 等)有关的数据?我现在考虑的方式是 mpg 的数据只是“嵌套”了,因此它没有显示,你只是给它一个名字?你能解释一下变异步骤吗?我知道您在这里定义模型,但地图功能让我迷失了。感谢您的帮助,一旦我完全理解它,这将为我节省很多时间
  • 第一个嵌套创建一个 32 行 x 2 列的 tibble,其中列是 mpgValVal 是该行对应变量的值(disphp 等)。所以实际上,我们通过每个感兴趣的自变量对数据进行子集化。 2 x 5 tibble 是 tidy 函数的输出 - 它是回归输出的摘要。我建议在单个 lm 对象上运行 tidy 以查看它是如何工作的。 map:基本上第一个将data 列中的每一行映射到lm 函数。第二个将model 列中的每一行映射到tidy 函数。
  • 这里有很多方法要消化,所以我把它分解成步骤。花点时间,您可能会受益于该主题的良好教程或指南。它包含在dplyr + broom vignettethis blog postthis one 中。
  • 感激不尽,这真是太棒了。我只需要想象它在做什么,我认为可以更好地理解它。因此,如果我们将其分解,则该 tibble(5 x 2)有 32 个 var 条目,对吗?但我们正在细分它?有 32 个条目,然后是 mpg 的 32 个数据观察值,然后是与 disp 对应的 32 个值?然后它转到 hp 那里有 32 个条目,然后是 32 个 mpg 条目,然后是 value 的相应值。本质上,您是在用变量替换汽车的名称并保留 mpg?
  • 是的,您正确理解了 32 x 2 小标题。 tidied 列中的 2 x 5 小标题包含您在运行 unnest 时看到的内容:列 termestimatestd.errorstatisticp.value,以及行 (Intercept)Val - 其中Val 是来自lm 的感兴趣变量的系数。将data 视为包含每个相关/独立组合的数据,将model 视为包含每个 lm,将tidied 视为包含每个 lm 摘要。
猜你喜欢
  • 2015-07-19
  • 2020-05-20
  • 1970-01-01
  • 1970-01-01
  • 2020-03-06
  • 1970-01-01
  • 1970-01-01
  • 2020-06-07
  • 1970-01-01
相关资源
最近更新 更多