【发布时间】:2020-04-14 06:21:34
【问题描述】:
我的数据集中有大约 7000 个家庭,对于每个家庭,我都有父母的收入和他们孩子的收入。现在我想对父母的收入对其子女的收入进行简单的线性回归。但是,我需要确保为每个家庭运行此回归。
示例数据集:
income_parents <- c(1000, 15000, 4500, 7000, 6500, 2500, 3500, 9000, 1200)
income_children <- c(1200, 7500, 2500, 8000, 5500, 7500, 3250, 7500, 850)
family_name <- c("Miller", "Smith", "Clark", "Powell", "Brown", "Jone", "Garcia", "Williams", "Lopez")
df <- data.frame(income_parents, income_children, family_name)
我在按family_name分组后运行以下回归:
df_AR <- df %>% group_by(family_name)
AR_1 <- lm(income_children ~ income_parents, data = df_AR)
summary(AR_1)
现在我想知道,lm() 函数是否考虑了嵌套数据结构?如果不是:如何更改我的代码以使其考虑在内?
【问题讨论】:
标签: r group-by dplyr linear-regression