【发布时间】:2020-07-01 15:07:49
【问题描述】:
我想构建一个可以识别图像中对象的计算机视觉模型。例如,识别某人手的边界框的 (x, y, width, height) 像素坐标。我知道像 YOLO 和 RCNN 这样的复杂对象检测算法,但我很好奇为什么我不能创建一个带有 4 个神经元(每个坐标值)输出层和线性激活函数的 vanilla Conv Net?
为了清楚起见,我不想识别图像中的多个对象。假设每张图片中只有一只手。
任何帮助将不胜感激!
【问题讨论】:
-
当然可以,您正在比较完全不同问题的算法。
-
@Dr.Snoopy 我会说单物体检测与多物体检测并没有完全不同......
-
也就是说,单个对象检测(实际上称为对象定位)是一个比对象检测简单得多的问题,其中对象可能存在也可能不存在,并且具有多个可变数量。
标签: tensorflow keras conv-neural-network yolo