【问题标题】:nls - convergence errornls - 收敛误差
【发布时间】:2014-10-31 18:41:27
【问题描述】:

对于这个数据集:

dat = structure(list(x = c(5L, 5L, 5L, 5L, 10L, 10L, 10L, 10L, 15L, 
15L, 15L, 15L, 17L, 17L, 17L, 17L, 20L, 20L, 20L, 20L, 20L, 20L, 
20L, 20L, 22L, 22L, 22L, 22L, 24L, 24L, 24L, 24L, 25L, 25L, 25L, 
25L, 27L, 27L, 27L, 27L, 30L, 30L, 30L, 30L, 35L, 35L, 35L, 35L), 
y = c(2.2, 2.2, 1.95, 1.9, 4.1, 3.95, 3.75, 3.4, 5.15, 4.6, 
4.75, 5.15, 3.7, 4.1, 3.9, 3.5, 7, 6.7, 6.7, 6.95, 4.95, 6, 6.45, 
6.4, 7, 4.45, 6.15, 6.4, 7, 6.6, 6.7, 7, 4.5, 4.7, 5.75, 4.35, 
5.4, 5.15, 5.7, 5.7, 0, 0, 0.5, 0, 0, 0, 0, 0)), .Names = c("x", "y"), 
row.names = c(6L, 7L, 8L, 9L, 10L, 11L, 12L, 13L, 14L, 
15L, 16L, 17L, 34L, 35L, 36L, 37L, 18L, 19L, 20L, 21L, 38L, 39L, 
40L, 41L, 42L, 43L, 44L, 45L, 46L, 47L, 48L, 49L, 22L, 23L, 24L, 
25L, 50L, 51L, 52L, 53L, 26L, 27L, 28L, 29L, 30L, 31L, 32L, 33L), 
class = "data.frame")

其中“x”是温度,“y”是生物过程

的响应变量

我正在尝试适应这个功能

beta.reg<-function(x, Yopt,Tmin,Topt,Tmax, b1) {
Yopt*((x-Tmin)/(Topt-Tmin))^(b1*(Topt-Tmin)/(Tmax-Topt))*((Tmax-x) / (Tmax-Topt)) ^ b1
}

mod <- nls(y ~ beta.reg(x, Yopt,Tmin,Topt,Tmax, b1), data=dat,
       start=c(Yopt=6, Tmin=0.1, Topt=24, Tmax=30, b1=1),
       control=nls.control(maxiter=800))

但是,我收到此消息错误:

错误 en numericDeriv(form[[3L]], names(ind), env) : 评估模型时产生的缺失值或无穷大

我已经用另一个类似的数据集尝试了相同的功能,并且正确地拟合...

 rnorm<-(10)
 y <- c(20,60,70,49,10)
 rnorm<-(10)
 y <- c(20,60,70,49,10)
 dat<-data.frame(x = rep(c(15,20,25,30,35), times=5),
              rep = as.factor(rep(1:5, each=5)),
              y = c(y+rnorm(5), y+rnorm(5),y+rnorm(5),y+rnorm(5),y+rnorm(5)))

有人可以帮我解决这个问题吗?

会话信息:

R version 3.1.1 (2014-07-10)
Platform: x86_64-pc-linux-gnu (64-bit)

attached base packages:
[1] stats     graphics  grDevices utils     datasets  methods   base     

other attached packages:
[1] nlme_3.1-118        latticeExtra_0.6-26 RColorBrewer_1.0-5  lattice_0.20-29    

loaded via a namespace (and not attached):
[1] grid_3.1.1  tools_3.1.1

【问题讨论】:

  • 这是在 R 中吗?如果是这样,那么您应该添加r 标签。

标签: r nls convergence


【解决方案1】:

这里有很多问题,我怀疑它可以在 SO 帖子中充分涵盖,但这应该可以帮助您入门。

首先,您似乎想要Tmax &lt; max(dat$x),例如x 的某些值,然后Tmax - x &lt; 0 以及当您尝试将负数提高到幂时(在公式的第二项),你得到NA's。这是错误消息的原因。

其次,非线性模型的收敛取决于模型公式和数据,因此过程收敛于一组数据而不是另一组数据这一事实是完全不相关的。

第三,非线性建模迭代地最小化作为参数函数的残差平方和。如果 RSS 表面具有局部最小值,并且您的 start 接近 1,算法会找到它。但只有 全局最小值 才是真正的解决方案。你的问题有很多很多的局部最小值。

第四,nls(...)默认使用高斯牛顿法。众所周知,高斯牛顿在移动参数(预测变量中添加或减去的参数,因此在您的情况下为TminTmax)时不稳定。幸运的是,minpak.lm 包实现了 Levenberg Marquardt 方法,该方法在这些条件下更加稳定。该包中的nlsLM(...) 函数使用与nls(...) 相同的调用序列并返回nls 类型的对象,因此该对象类的所有方法都可以正常工作。使用它。

第五,非线性回归(实际上是所有最小二乘回归)的一个基本假设是残差是正态分布的。因此,您必须使用 QQ 图来验证任何解决方案。

第六,你的模型有一组反常的特征。当Tmin -&gt; -Inf 模型中的第一项接近1。事实证明,与Tmin 小于min(dat$x) 的任何其他值相比,这产生了更低的RSS,因此所有算法都倾向于将Tmin 驱动为较大的负值。你可以很容易地看到这一点:

library(minpack.lm)
mod <- nlsLM(y ~ beta.reg(x, Yopt,Tmin,Topt,Tmax, b1), data=dat,
             start=c(Yopt=6,Tmin=0,Topt=24,Tmax=50, b1=1),
             control=nls.lm.control(maxiter=1024,maxfev=1024))
coef(summary(mod))
#         Estimate   Std. Error     t value     Pr(>|t|)
# Yopt    6.347019    0.2919686 21.73870235 8.055342e-25
# Tmin -155.530098 2204.0011003 -0.07056716 9.440694e-01
# Topt   21.157545    0.6702713 31.56564484 2.240134e-31
# Tmax   35.000000   11.4838614  3.04775537 3.933164e-03
# b1      3.321326    9.1844548  0.36162468 7.194035e-01
sum(residuals(mod)^2)
# [1] 50.24696

par(mfrow=c(1,2))
plot(y~x,dat)
with(as.list(coef(mod)),curve(beta.reg(x, Yopt,Tmin,Topt,Tmax, b1),add=TRUE))
qqnorm(residuals(mod))

这看起来很合适但事实并非如此:QQ 图显示残差不太正常。事实上,Tminb1 的估计值都非常差,Tmin 的值在物理上没有意义,这是数据问题,而不是拟合问题。

第七,原来上面的拟合实际上是一个局部最小值。我们可以通过对TminTmaxb1 进行网格搜索来看到这一点(省略YoptTopt 以节省时间,因为无论起点如何,这些参数都可以很好地估计)。

init <- c(Yopt=6, Topt=24)
grid <- expand.grid(Tmin= seq(0,4,len=100),
                    Tmax= seq(35,100,len=10),
                    b1  = seq(1,10,len=10))
mod.lst <- apply(grid,1,function(gr){
  nlsLM(y ~ beta.reg(x, Yopt,Tmin,Topt,Tmax, b1), data=dat,
        start=c(init,gr),control=nls.control(maxiter=800)) })
rss <- sapply(mod.lst,function(m)sum(residuals(m)^2))
mod <- mod.lst[[which.min(rss)]]   # fit with lowest RSS
coef(summary(mod))
#        Estimate   Std. Error      t value     Pr(>|t|)
# Yopt   6.389238    0.2534551 25.208557840 2.177168e-27
# Topt  22.636505    0.5605621 40.381798589 7.918438e-36
# Tmin  35.000002  104.6221159  0.334537316 7.396005e-01
# Tmax  36.234602  133.4987344  0.271422809 7.873647e-01
# b1   -41.512912 7552.0298633 -0.005496921 9.956395e-01
sum(residuals(mod)^2)
# [1] 34.24019

plot(y~x,dat)
with(as.list(coef(mod)),curve(beta.reg(x, Yopt,Tmin,Topt,Tmax, b1),add=TRUE))
qqnorm(residuals(mod))

从数学上讲,这是一个明显优越的拟合:RSS 较低,残差更接近正态分布。同样,参数没有得到很好的估计,并且在物理上没有意义的事实是数据(可能还有模型公式)的问题,而不是拟合过程。

以上所有情况都表明您的模型存在问题。从数学上讲,它的一个问题是该函数在(Tmin,Tmax) 之外没有为x 定义。由于您将数据输出到x=35,因此拟合算法将永远不会产生Tmax &lt; 35(如果它收敛)。处理此问题的方法会稍微改变您的模型函数,以在该范围之外剪辑到 0。 (不过,根据您的问题的物理性质,我不知道这是否合法......)。

beta.reg<-function(x, Yopt,Tmin,Topt,Tmax, b1) {
  ifelse(x>Tmax,0,
    ifelse(x<Tmin,0,
      Yopt*((x-Tmin)/(Topt-Tmin))^(b1*(Topt-Tmin)/(Tmax-Topt))*((Tmax-x) / (Tmax-Topt)) ^ b1
  ))
}

用这个函数运行上面的代码会产生:

coef(summary(mod))
#         Estimate   Std. Error     t value     Pr(>|t|)
# Yopt   6.1470413   0.21976766   27.970636 3.202940e-29
# Tmin -52.8172658 184.16899439   -0.286787 7.756528e-01
# Topt  23.0777898   0.63750721   36.200045 7.638121e-34
# Tmax  30.0039413   0.02529877 1185.984187 1.038918e-98
# b1     0.5966129   0.32439982    1.839128 7.280793e-02

sum(residuals(mod)^2)
# [1] 28.10144

par(mfrow=c(1,2))
plot(y~x,dat)
with(as.list(coef(mod)),curve(beta.reg(x, Yopt,Tmin,Topt,Tmax, b1),add=TRUE))
qqnorm(residuals(mod))
qqline(residuals(mod))

事实上,网格搜索产生完全相同的结果,与起点无关。请注意,RSS 低于早期模型的任何结果,并且 b1 的估计要好得多(并且 非常 与早期模型函数的估计不同)。残差仍然不正常,但在这种情况下,我想检查数据中的异常值。

【讨论】:

  • 伟大的@jlhoward!我也认为数据集有很多问题,但它是生物学......我会评论你回复的每一点:第一个 - 显然,如果我测试温度 > 30°c 会有大约 0 的响应。我想排除35°C点,要有Tmax &lt; max(x);第二-我只是举第二个例子来证明这个函数确实有效并给出了曲线形状的概念; 4th-我真的不知道那个包,它看起来不错! 6-在未来的实验中,我将降低 T°C 以避免这种错误Tmin &lt; min(dat$x)
  • 你最后的模型似乎有最好的生物学意义,没有考虑Tmin。我认为,用这个模型和数据集估计Tmin 会很困难。您如何看待用 x 的子集 Tmin?可以解决吗?
  • 在我这样做之前,我会查看x ~ 17 周围的数据。这些复制品有些奇怪:很难解释为什么您的反应与x ~ 10 相同,而且这些点解释了残差中大部分与正态性的偏差。您可以考虑排除那些重复并重新拟合。
  • 安装“minpak.lm”包时出现此消息错误:[ install.packages 中的警告:包 'minpak.lm' 不可用(对于 R 版本 3.1.2)]
  • 它是 minpack.lm,带有一个“c”。
【解决方案2】:

为@jlhoward 的解决方案添加另一种可能的解决方案...

我找到了这个nls2 包:

library("nls2")

从原始数据集中排除x~17,35

newdat <- subset(dat, x!=17 & x!=35 )

将函数应用于缩减数据集:

beta.reg<-with(newdat,  
           y ~ Yopt*((x-Tmin)/(Topt-Tmin))^(b1*(Topt-Tmin)/(Tmax-Topt))*((Tmax-x) / Tmax-Topt))^b1
           )

创建一组启动器:

st1 <- expand.grid(Yopt = seq(4, 8, len = 4),
                   Tmin = seq(0, 4, len = 4), 
                   Topt = seq(15, 25, len = 4),
                   Tmax= seq(28, 38, len = 4),
                   b1 = seq(0, 4, len = 4))

拟合模型:

mod <- nls2(beta.reg, start = st1, algorithm = "brute-force")

提取系数:

round(coef(summary(mod)),3)

#     Estimate Std. Error t value Pr(>|t|)
# Yopt    6.667      0.394  16.925    0.000
# Tmin    0.000     12.023   0.000    1.000
# Topt   21.667      0.746  29.032    0.000
# Tmax   31.333      1.924  16.289    0.000
# b1      1.333      1.010   1.320    0.197

诊断:

sum(residuals(mod)^2)

# [1] 50.18246

最后,调整后的函数和 QQ 正态图:

par(mfrow=c(1,2))
with(newdat,plot(y~x,xlim=c(0,35))) 
points(fitted(mod)~I(newdat$x), pch=19)
with(as.list(coef(mod)),
 curve(
  Yopt*((x-Tmin)/(Topt-Tmin))^(b1*(Topt-Tmin)/(Tmax-Topt))*((Tmax-x) / (Tmax-Topt)) ^ b1,
   add=TRUE, col="red"))

qqnorm(residuals(mod))
qqline(residuals(mod))

【讨论】:

  • 作为记录,nls2(...)(当您使用它时)不会最小化 RSS,它会在 4^5 = 1024 个网格点中的每一个处计算 RSS,并报告具有最低 RSS 的点.这就是你得到Tmin=0的原因; Tmin 的较低值将提供较低的 RSS,但这是您网格中的最低值。
  • 这是真的。通过这种方式,我试图将Tmin 的估计限制在一些生物学意义上的值,从而牺牲了RSS。这和你上一个模型的限制一样吗? beta.reg&lt;-function(x, Yopt,Tmin,Topt,Tmax, b1) { ifelse(x&gt;Tmax,0, ifelse(x&lt;Tmin,0, Yopt*((x-Tmin)/(Topt-Tmin))^(b1*(Topt-Tmin)/(Tmax-Topt))*((Tmax-x) / (Tmax-Topt)) ^ b1 )) }
  • 没有。如果x(Tmin,Tmax) 范围之外,上述模型仅限制函数返回0。它根本不限制TminTmax。您所做的是在给定所选参数空间的情况下找到最小 RSS(或多或少,这是一个非常粗略的网格)。这是 RSS 意义上的“最佳拟合”,但您应该知道,当您这样做时,拟合的统计信息(参数的 se 值等)完全没有意义。
  • 此外,所有技术都讲述了关于 Tmin 的相同故事 - 根据您的数据和此模型,它无法准确估计。在另一个答案的最后一个模型中,Tmin ~ -52 +/- 360,所以它可以是任何东西。但是请注意,不同的方法对b1 的估计是多么不同。
猜你喜欢
  • 1970-01-01
  • 2016-01-25
  • 2017-11-24
  • 1970-01-01
  • 2012-11-11
  • 2014-08-15
  • 1970-01-01
  • 2016-07-10
  • 1970-01-01
相关资源
最近更新 更多