【问题标题】:How do instance segmentation methods deal with partially labelled data?实例分割方法如何处理部分标记的数据?
【发布时间】:2022-01-12 20:38:19
【问题描述】:
假设我有一个包含猫和狗的标记图像的数据集。假设在包含狗的图像中,只有 50% 的猫实例被标记。此外,我们假设 50% 包含狗的图像将包含猫。我想用边界框、掩码和分数对狗或猫的每个实例进行分类(即,我使用的是 Mask-RCNN)。
这里的问题是:未标记的猫实例会影响模型的分类/分割头吗?有一个简单的原因吗?
我问过的大多数人都声称他们对模型的质量没有影响,但他们无法解释为什么会这样。我认为这里的部分问题是我对“经典”模型有更多的经验,其中每个数据点都会导致损失。我还认为我说的深度学习语言/行话不够好,不知道从哪里开始寻找答案。请帮忙!
【问题讨论】:
标签:
deep-learning
image-segmentation
【解决方案1】:
这取决于学习设置的制定。如果您将每个图像视为样本的集合,即其中包含的对象,每个对象都有其边界框和{cat, dog} 中的标签,那么您应该没问题。本质上,您将要求生成一个边界框和一个标签,每一个都将与一个基本事实相匹配。边界框或标签的错误预测会通过将它们与相应的事实进行对比而产生错误信号,这意味着您有一些东西可以惩罚您的模型(或训练它)。缺少的标签不会与任何东西形成对比,基本上意味着您只是未充分利用您的图像,这本身并不会破坏交易。
另一方面,如果您从单个图像生成所有边界框,并因创建“冗余”框而惩罚您的模型,则您冒着惩罚未标记的正确预测的风险,这确实很糟糕。如果惩罚好的预测的数量与惩罚的坏预测的数量相当,那么你弊大于利。
也许要走的路是从仅对具有完整且正确标签的图像进行训练开始,然后继续将嘈杂的图像包括在内,手动检查“额外”预测是否实际上对应于真实但未标记的实体,然后根据需要进行人工在环培训来修复数据。