【问题标题】:How to use two different sized images as input into a deep network?如何使用两个不同大小的图像作为深度网络的输入?
【发布时间】:2018-10-05 08:54:27
【问题描述】:

我正在尝试训练一个深度神经网络,该网络使用来自两个单独图像的信息以获得类似于this 的最终图像输出。不同之处在于我的两个输入图像没有任何空间关系,因为它们是具有不同信息量的完全不同的图像。如何使用双流 CNN 或使用此类输入的任何其他架构?

供参考:一张图片尺寸为 (5184x3456),另一张尺寸为 (640x240)。

【问题讨论】:

  • 缩放图像会破坏表示吗?
  • 也可以试试padding
  • 只需创建两个并行网络,并在某些时候使用(如论文所述)特征连接或对两者应用一些二元运算符将它们折叠成一个流。您的问题非常广泛,无法得到具体答案。

标签: deep-learning


【解决方案1】:

首先:你有两个图像并不重要。当您将一张图像作为输入时,您会遇到完全相同的问题,而该单张图像可以具有不同的大小。

解决这个问题有多种策略:

  • 裁剪和缩放:只需强制输入您需要的大小。进行裁剪以确保纵横比正确。有时,相同的图像但不同部分会被输入到网络中,然后将结果合并(例如平均)。
  • 卷积 + 全局池化:卷积层不关心输入大小。在您关心它的地方,您可以发送global pooling。这意味着您有一个池化区域,该区域将始终覆盖整个输入,无论大小如何。
  • 特殊层:我不记得概念或名称,但有些层允许不同大小的输入……也许这是基于注意力的方法之一?

结合两个输入

在您选择的框架中寻找“合并层”或“连接层”:

另见

【讨论】:

猜你喜欢
  • 1970-01-01
  • 2018-01-31
  • 1970-01-01
  • 2018-10-23
  • 2017-03-24
  • 1970-01-01
  • 1970-01-01
  • 2018-08-18
  • 2023-03-22
相关资源
最近更新 更多