【问题标题】:How to solve the "cold start" problem in computer vision based deep learning models?如何解决基于计算机视觉的深度学习模型中的“冷启动”问题?
【发布时间】:2023-03-11 12:03:01
【问题描述】:

我所说的“冷启动”是指用于对象检测或语义分割的计算机视觉模型通常每类需要大约 5000 张图像。因此,如果一个想法在公司内部浮动,例如我们希望在派送卡车时使用对象检测来计算木材原木的数量,然后使用同一个应用程序来计算收到的数量。

所以现在的挑战是,您只有几张卡车上的木头图像,但要训练任何模型都需要数千张,那么从业者通常会为这些原型做什么?

因为现阶段还不清楚要尝试什么模型?要求企业投资收集数千张日志图像并标记它们也不是很可行?

这就是我称之为“冷启动”的原因。如何开始?

我研究的是 Conditional GANs,Pix-2-Pix,但我试图了解当每个对象类的图像很少时如何开始的推荐方法。

我希望当我将一些图像放入一个文件夹并调用这个库时,我最终会在每个类中获得更多图像,这样我就可以开始我的原型设计了。

【问题讨论】:

    标签: image-processing machine-learning deep-learning yolo


    【解决方案1】:

    请注意,这里要求软件库是特别题外话。

    不,没有神奇的解决方案:如果您的数据集的图像中没有足够的信息来训练手工制作的模型,那么再多的软件也无法改变这一事实。然而,第一种方法是挑战这个“事实”:你怎么知道你没有足够的图像?当你使用你必须训练的模型时发生了什么?您将在模型收敛之前训练更多的 epoch,但通过训练相当数量的迭代,您应该能够获得比随机准确度更好的结果。

    我严重怀疑您是否需要收集和标记数千张图像:您的范式非常有限,从您控制的有利位置拍摄的原木卡车照片。训练一个模型来计算不重叠的近圆比区分机动车辆和邮政信箱所需的区分要少得多。

    用您手头的基本模型进行实验——您已经拥有比您意识到的更多的解决方案。如果您的数据集太小,请带着数码相机到院子外,获取两倍、三倍的数据,无论您需要什么。左右翻转图像以获得更多输入。

    这会让你感动吗?

    【讨论】:

    • 是的,谢谢。需要明确的问题是我还没有模型。我所拥有的是业务向我发送了这个场景,说我们可以使用 AI 来计算卡车上装载的日志数量。所以我只有2-3张图片。现在我需要尝试看看我能得到什么样的准确性,甚至建议他们什么是最好的方法。这就是为什么我想知道是否有什么东西可以拍摄我的 2-3 张图像,然后创建数千张,以便我可以训练基线模型。这种情况经常发生,企业会发送一些图片并询问这是否可能。
    • 啊——所以你是一个远程顾问,而不是一个随时可以进入船厂的员工?这种情况常见吗?是的,你在这里有一点关系沟通。共有 26 个原木末端的 3 张照片(视觉结构非常相似)与 3 张照片各显示一个非同质项目之间存在显着差异。
    • 此外,仅在您的 3 张照片(和 3 张镜像)上进行部分训练的模型可用于高度准确地标记其他照片。与从头开始相比,手动更正所需的时间应该更少。
    【解决方案2】:

    迁移学习解决了您描述为“冷启动”的问题。基本上,您可以使用大型开放数据集导入训练后获得的权重,并使用您已有的较小数据集对其进行微调。数据增强、冻结某些层等可能有助于改进微调模型的结果。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2013-09-29
      • 2021-09-22
      • 2020-02-01
      • 2017-10-22
      • 1970-01-01
      • 1970-01-01
      • 2020-11-03
      • 2012-03-25
      相关资源
      最近更新 更多