【发布时间】:2019-12-17 15:05:25
【问题描述】:
我正在分析来自 American Housing Survey 的数据,该数据带有复制权重以计算正确的标准误差,在 R 中使用 survey,但我想确保我正确指定了设计。
这是我的做法:
svy <- svrepdesign(data = ahs,
weight = ~WEIGHT,
repweights = "REPWEIGHT[0-9]+",
type = "Fay",
rho = 0.5,
scale = 4/160,
rscales = rep(1, 160),
mse = TRUE)
我将rho 设置为0.5,因为在使用人口普查局发布的复制权重指南的第 3.1 节中,他们解释了如何使用 SAS (https://www.census.gov/content/dam/Census/programs-surveys/ahs/tech-documentation/2015/Quick%20Guide%20to%20Estimating%20Variance%20Using%20Replicate%20Weights%202009%20to%20Current.pdf) 计算标准误差,他们说要使用选项 VARMETHOD=BRR(FAY) 不指定任何其他选项,根据 SAS 文档 (http://support.sas.com/documentation/onlinedoc/stat/142/surveymeans.pdf),此参数的默认值为 0.5。
我将 mse 设置为 TRUE 是因为,在他们在第 4 节中给出的标准误差公式中,平方偏差的总和是围绕使用完整样本权重计算的统计量的估计值计算的。
最后,我将scale 设置为4/160 和rscales 设置为rep(1, 160),因为在同一个公式中,平方偏差的总和乘以4/160,但求和运算符中没有乘数。
但是,当我查看 Anthony Joseph Damico 关于美国住房调查 (http://asdfree.com/american-housing-survey-ahs.html) 的网页时,他会这样做:
ahs_design <-
svrepdesign(
weights = ~ wgt90geo ,
repweights = "repwgt[1-9]" ,
type = "Fay" ,
rho = ( 1 - 1 / sqrt( 4 ) ) ,
mse = TRUE ,
data = ahs_df
)
忘记重量变量的名称,它在 2015 年刚刚更改(大概是在他写了那个网页之后),他和我做的一样,只是他没有指定 scale 和 rscales。根据我上面解释的内容和survey 的文档,在我看来,他应该像我一样指定它们,但我以前从未使用过survey 的复制权重,所以我想确定一下。
P。 S. 我发现更奇怪的是,当我尝试不指定 scale 和 rscales 时,我计算的标准错误似乎与我做的时候相同。这意味着在实践中我如何做到这一点可能并不重要,但是由于如果我指定scale 和rscales,用于计算标准误差的公式应该是不同的,我仍然想了解为什么它似乎不会影响survey 计算的标准误差。
P。 S. bis:我不明白的另一件事是,尽管人口普查局说它使用了 Fay 方法并建议使用 SAS 程序,这将导致 Fay 系数为0.5,但似乎没有是其发布的指南中给出的标准误差公式中的任何 Fay 系数。这意味着,如果我要编写自己的代码来使用该公式计算标准误差,结果可能与我使用 survey 和 rho 或 0.5 或人口普查局推荐的 SAS 程序时不同Bureau 来计算标准误差,这对我来说没有多大意义。
【问题讨论】: