【发布时间】:2021-04-04 02:28:50
【问题描述】:
labelled <- read.table(header=TRUE, text="
veh_value exposure clm
3.33 0.73 0
0.99 0.82 1
3.44 0.74 1
2.50 0.68 0
4.05 0.11 1
")
unlabelled <- read.table(header=TRUE, text="
veh_value exposure
2.77 0.44
0.86 0.10
4.27 0.02
2.47 0.29
1.43 0.25
")
##Preprocessing of both data sets
labelled$veh_value =cut(labelled$veh_value,breaks=c(quantile(labelled$veh_value,probs=seq(0,1,by=0.25))))
labelled$exposure = cut(labelled$exposure,breaks=c(quantile(labelled$exposure,probs=seq(0,1,by=0.25))))
labelled$clm = as.factor(labelled$clm);
unlabelled$veh_value=cut(unlabelled$veh_value,breaks=c(quantile(unlabelled$veh_value,probs=seq(0,1,by=0.25))))
unlabelled$exposure =cut(unlabelled$exposure,breaks=c(quantile(unlabelled$exposure,probs=seq(0,1,by=0.25))))
##Training Model for labelled data
library(e1071)
NBclassfierlabel=naiveBayes(clm~veh_value+exposure, laplace=1, data=labelled)
##Predicting posterior probabilities for the unlabelled data
predict<- predict(NBclassfierlabel, newdata=unlabelled, type="raw")
我已经包含了我的标记和未标记数据集的样本。我还包括预处理以在我的标记数据集上运行 naivebayes 算法。然后我想通过使用predict<- predict(NBclassfierlabel, newdata=unlabelled, type="raw") 来预测我的未标记集的后验概率当我运行此代码时,每一行都会返回相同的概率。你知道为什么会这样吗?非常感谢任何帮助。
【问题讨论】:
-
请分享一段可重现的数据,以便其他人可以更有效地帮助您。
标签: r