【发布时间】:2021-05-03 05:01:19
【问题描述】:
以下是我的 R 代码,用于创建模型,使用 R 编程从钻石数据集中预测钻石价格。在这里,我无法通过为每一行提供日志来创建模型。如果不使用日志,我会得到一个预测价格不正确的可怕模型。我还粘贴了显示的错误和数据集以供参考。
错误如下所示
> mod =(lm(log(price)~log(carat)+log(x)+log(y)+log(z),data=train))
Error in lm.fit(x, y, offset = offset, singular.ok = singular.ok, ...) :
NA/NaN/Inf in 'x'
此处附有数据集的链接: https://www.kaggle.com/shivam2503/diamonds
下面给出的是相同的代码
setwd ("C:/akash/study videos/virginia")
akash = read.csv("diamonds.csv")
#summary(akash)
ind = sample(2, nrow(akash),replace = TRUE , prob = c(0.8,0.2))
train = akash[ind==1,]
test = akash[ind==2,]
mod =(lm(log(price)~log(carat)+log(x)+log(y)+log(z),data=train))
summary(mod)
predicted = predict(mod,newdata = test)
mon = round(exp(predicted),0)
head(mon)
#head(test)
#View(akash)
【问题讨论】:
-
您链接到的数据中没有
z变量,但您已在模型中包含了一个变量。这似乎不正确。
标签: r machine-learning diamond-problem