【发布时间】:2016-06-07 08:48:19
【问题描述】:
我正在使用预训练的 GoogLeNet,然后在我的数据集上对其进行微调以对 11 个类别进行分类。验证数据集似乎给出了 86.5% 的“loss3/top1”。但是当我在评估数据集上评估性能时,它给了我 77% 的准确率。无论我对 train_val.prototxt 进行了哪些更改,我都在 deploy.prototxt 中进行了相同的更改。验证和评估准确性之间的差异是正常的还是我做错了什么? 有什么建议吗?
【问题讨论】:
-
~10% 的差异相当大。验证集中有多少样本,评估集中有多少?这些集合中的标签分布是否相同?
-
@Shai 验证数据集中的样本总数为 4123,评估中的样本总数为 4118。对于每个类,我确保验证和评估数据集中包含相同数量的图像。
-
这很奇怪。差异太大而不能被视为“样本错误”,但太小不能暗示主要错误......
-
@Shai 我应该怎么做才能解决这个问题,什么是主要错误?您认为评估程序有问题吗?
-
this thread 有用吗?
标签: machine-learning computer-vision neural-network deep-learning caffe