对于足够复杂的问题,找到合适的起始值可能很困难。但是,对于设置起始值(其文档不是很好,但存在),您应该学习阅读错误消息。以下是您尝试使用带有内置数据集的 start=1 的失败尝试:
>quine.nb1 <- glm.nb(Days ~ Sex + Age + Eth + Lrn, data = quine,
link=sqrt, start=1)
Error in glm.fitter(x = X, y = Y, w = w, start = start, etastart = etastart, :
length of 'start' should equal 7 and correspond to initial coefs for
c("(Intercept)", "SexM", "AgeF1", "AgeF2", "AgeF3", "EthN", "LrnSL", )
它准确地告诉您它所期望的:要估计的每个系数的值向量。
quine.nb1 <- glm.nb(Days ~ Sex + Age + Eth + Lrn, data = quine,
link=sqrt, start=rep(1,7))
有效,因为我给出了一个长度为 7 的向量。您可能必须使用其中的实际值来获得一个始终预测正值的模型。在glm.nb 中生成起始值的默认算法可能会在某处给出负面预测,而sqrt 链接不能容忍这种情况(与log 不同)。如果您无法手动找到有效的起始值,您可以尝试运行一个更简单的模型,并将其他参数的估计值扩大为 0,以获得良好的起始位置。
编辑:建立模型
假设您无法为您的复杂模型找到有效的起始值。然后从一个简单的开始,例如
> nb0 <- glm.nb(Days ~ Sex, data=quine, link=sqrt)
> coef(nb0)
(Intercept) SexM
3.9019226 0.3353578
现在让我们使用之前的起始值添加下一个变量,方法是为新变量的效果添加 0 个估计值(在这种情况下,Age 有四个级别,因此需要 3 个系数):
> nb1 <- glm.nb(Days ~ Sex+Age, data=quine, link=sqrt, start=c(coef(nb0), 0,0,0))
> coef(nb1)
(Intercept) SexM AgeF1 AgeF2 AgeF3
3.9127405 -0.1155013 -0.5551010 0.7475166 0.5933048
您通常希望继续添加 0 而不是例如 100,因为系数 0 意味着新变量没有影响 - 这正是您刚刚拟合的更简单模型所假设的。