【问题标题】:Recognizing multiple objects in an image with convolutional neural networks使用卷积神经网络识别图像中的多个对象
【发布时间】:2017-06-07 11:19:06
【问题描述】:

我已经看到不少用于识别图像的 CNN 代码示例,但它们通常与目标关系的 1 对 1 输入相关(如 MNISt 手写数字集),并且大多数似乎使用相似的图像输入图像和训练图像的尺寸(像素)。

那么...在一张图像中识别多个对象的常用方法是什么? (如几个人,或任何其他相对复杂的场景)。我已经经常看到它完成了,但还没有看到提到的设计方法。这是否需要某种类型的预处理,还是可以由 CNN 直接处理?

【问题讨论】:

    标签: image-processing conv-neural-network


    【解决方案1】:

    我想说从图像中检索多个对象的最著名的技术家族是检测家族。

    使用检测,其基本思想是在图像中具有一个或多个不同大小和比率的建议窗口,由计算或随机的算法数组生成.

    对于每个 Proposal 窗口,然后执行 Classification 算法以揭示图像的特定区域所代表的内容。

    下一步通常是运行 Merge 过程,将所有相邻区域合并为一个分类输出。

    注意:None 类通常也用于表示没有找到特定类的区域。

    【讨论】:

    • 合并过程可以改为反向像素函数,这样每个提案窗口将相关像素标记为可能候选对于该分类,然后在所有提案窗口标记相关像素之后,将一些函数(如 max)应用于每个像素分类。这可以创建分类对象的轮廓轮廓,而不仅仅是框。
    • 太棒了!正如经常发生的那样,几个关键字对于引导网络搜索很有价值。为了其他人搜索的利益:一个很好的关键字是“R-CNN”,Facebook 的 Ross Gershick 和其他人的变体,包括“Fast R-CNN”和“Faster R-CNN”。似乎早期的方法依赖于多次通过,并且已经付出了巨大的努力来合并成一个单一的过程。 (我需要进一步研究)。
    • @wontonimo:你知道使用轮廓线的例子吗?到目前为止我看到的所有东西都使用边界框。
    • @Hugh 当然,“convnet 轮廓对象”的谷歌图像搜索将为您找到。 graphics.ethz.ch/~perazzif/masktrack/index.html
    • 太棒了!谢谢大家。这正是我一直在寻找的。现在,如果我能找到一些 TensorFlow 代码,我就会走上正轨。
    猜你喜欢
    • 2017-02-12
    • 2016-10-23
    • 2019-12-10
    • 2021-03-30
    • 2017-01-01
    • 1970-01-01
    • 2013-12-25
    • 2018-10-19
    相关资源
    最近更新 更多