【问题标题】:Using Augmented Data Images in Testing在测试中使用增强数据图像
【发布时间】:2018-03-11 18:44:56
【问题描述】:

我正在研究人员重新识别问题,并正在使用 CMC 曲线显示结果。 我在训练集中使用了增强数据/图像以及普通图像(目前在 CUHK01 上训练)。在测试我是否不使用增强数据以及我的正常测试图像来计算排名时假设 Rank_1 我得到了 ~30% 的 Rank_1 另一方面使用增强数据给了我 ~65-70% 的 Rank_1(这就目前世界上的 Rank_1 准确度而言,高得离奇)。

所以我的问题是

a) 增强数据如何影响测试集,尤其是在我的情况下。

b) 我是不是过度拟合或类似的东西。

c) 避免在测试用例中使用增强图像是一般规则吗?

【问题讨论】:

    标签: machine-learning computer-vision conv-neural-network face-recognition pytorch


    【解决方案1】:

    使用数据增强的原因是为了减少过度拟合的机会。通过这种方式,您想告诉您的模型参数 (theta) 与您正在扩充的数据 (alpha) 不相关。这可以通过将每个输入增加每个可能的 alpha 来实现。但这与现实相去甚远,原因有很多,例如时间/内存限制,您可能无法构建所有可能的增强等,因此可能存在一些偏差。尽管如此,它仍然会减少过度拟合数据集的机会,但它可能会过度拟合您的扩充。

    因此,如果您有增强功能,您可能会因为过度拟合而通过匹配增强数据来获得更高的准确性,这是问题 a 的答案。所以我相信问题b的答案是肯定的。

    为了回答问题 c,我没有阅读有关数据扩充的规则,但在机器学习的文献中,我假设它们避免了对测试集的任何扩充。例如我引用a paper

    我们通过以下方式扩充训练图像 用随机背景图像替换绿屏,以及 通过内在重新着色来改变外观的颜色和阴影

    【讨论】:

    • 嗯,我很抱歉,但我仍然无法感受到它。一方面,我们说数据增强有助于避免过度拟合,但由于过度拟合,我们不能将其用于测试用例。你或任何人知道任何研究论文或任何来源吗?此外,我的测试用例不仅有增强数据,它还结合了两者或更多类似随机排列的图像。
    • 我想我们都同意增加训练集的原因(这是模型的泛化)。但是增加测试集的原因应该是什么?
    • 好吧,基本上我看到的增强数据更像是更多数据(尽管有重复的图像集),而且做更稳健的测试来验证你的模型也没有什么坏处
    • 现在,自从我写了我的最后一条评论后,我觉得我明白了为什么不使用增强数据背后的逻辑,如果我的图像对得到一个真正的肯定案例,可以说 [image_a,image_b]而不是使用这些案例的增强数据或类似的东西只会提高我的测试准确性(可能是因为我的模型现在知道模式并且对图像的增强数据具有鲁棒性)。你认为我的想法或逻辑看起来不错还是一个体面的解释?很抱歉在这些问题上浪费了您的时间
    • 将扩充集视为包含更多数据的集是有效的,因为分布是绝对随机的。说用于检测猫。如果您水平翻转猫图像而垂直没有猫图像,那么您的模型会学习这一点并识别测试集中水平翻转的猫。这只有在增强方法无偏且随机的情况下才能解决。但实际上,它可能无法实现。因此,为了避免这种偏差影响模型准确度的度量,生成的数据最好不要出现在测试集中,以免影响准确度度量。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2017-08-29
    • 2022-12-11
    • 2018-06-10
    • 1970-01-01
    • 1970-01-01
    • 2017-07-01
    • 1970-01-01
    相关资源
    最近更新 更多