【问题标题】:How to match the output shape of generator and the input shape of discriminator in GAN?GAN中生成器的输出形状和判别器的输入形状如何匹配?
【发布时间】:2019-06-18 11:51:39
【问题描述】:

我正在研究我的第一个 GAN 模型,我使用 MNIST 数据集遵循了 Tensorflows 官方文档。我已经顺利运行了。我试图用我自己的数据集替换 MNIST,我已经准备好它以匹配与 MNSIT 相同的大小:28 * 28,它可以工作。

但是,我的数据集比 MNIST 更复杂,因此我尝试将数据集的图像尺寸放大:512 * 512,但我不断收到与输入和输出形状相关的错误。我无法弄清楚鉴别器和生成器的所有这些输入和输出形状之间的关系。假设我想将我的数据集从 28 * 28(MNSIT 大小)更改为 y*y(自定义大小),我需要在这些层中调整哪些输入/输出形状?为什么?任何人都可以澄清这个流程?

这是我重塑数据集以匹配 MNIST 大小的代码:

train_images = train_images.reshape(train_images.shape[0], 28, 28, 1).astype('float32')

在这里我将其标准化:

train_images = (train_images - 127.5) / 127.5 # Normalize the images to [-1, 1]

这是生成器模型,其中最后一层的输出形状表示 28 * 28:

def make_generator_model():
model = tf.keras.Sequential()
model.add(layers.Dense(7*7*256, use_bias=False, input_shape=(100,)))
model.add(layers.BatchNormalization())
model.add(layers.LeakyReLU())

model.add(layers.Reshape((7, 7, 256)))
assert model.output_shape == (None, 7, 7, 256) # Note: None is the batch size

model.add(layers.Conv2DTranspose(128, (5, 5), strides=(1, 1), padding='same', use_bias=False))
assert model.output_shape == (None, 7, 7, 128)
model.add(layers.BatchNormalization())
model.add(layers.LeakyReLU())

model.add(layers.Conv2DTranspose(64, (5, 5), strides=(2, 2), padding='same', use_bias=False))
assert model.output_shape == (None, 14, 14, 64)
model.add(layers.BatchNormalization())
model.add(layers.LeakyReLU())

model.add(layers.Conv2DTranspose(1, (5, 5), strides=(2, 2), padding='same', use_bias=False, activation='tanh'))
assert model.output_shape == (None, 28, 28, 1)

return model

这是判别器模型,其中第一层的输入表示 28 * 28 :

def make_discriminator_model():
model = tf.keras.Sequential()
model.add(layers.Conv2D(64, (5, 5), strides=(2, 2), padding='same',
                                 input_shape=[28, 28, 1]))
model.add(layers.LeakyReLU())
model.add(layers.Dropout(0.3))

model.add(layers.Conv2D(128, (5, 5), strides=(2, 2), padding='same'))
model.add(layers.LeakyReLU())
model.add(layers.Dropout(0.3))

model.add(layers.Flatten())
model.add(layers.Dense(1))

return model

【问题讨论】:

    标签: python tensorflow keras neural-network deep-learning


    【解决方案1】:

    这里是计算 Conv2DTranspose 输出形状的公式,你可以将其视为一种可学习的上采样方式:

    # Padding==Same:
    H = H1 * stride
    
    # Padding==Valid
    H = (H1-1) * stride + HF
    

    在哪里,H = output sizeH1 = input sizeHF = height of filter。来自"how-to-calculate-the-output-shape-of-conv2d-transpose"

    所以Conv2DTranspose的输入输出形状应该是:

    (None, h1, h2, channels)
             ||
    Conv2DTranspose(num_filters, (kernel_h1, kernel_h2), strides=(s1, s2), padding='same')
             ||
    (None, h1*s1, h2*s2, num_filters)
    

    其中 None 是 batch_size

    要使代码可运行,您可以将第一个密集层的输出形状更改为(8*8*256) 并重复Conv2DTranspose->BatchNormalization->LeakyReLU 块,直到它变为(512*512)用于灰度或(512*512*3) 用于 RGB。
    对于判别器,唯一必要的更改只是第一层中的input_shape。因为Conv2Dpadding='same' 不会改变张量的形状。

    但是,上述更改并不能保证您的模型有良好的结果。你真的必须研究你的任务来决定你的模型架构应该是怎样的。

    【讨论】:

    • 感谢您的澄清。按照您的指导,我能够成功运行我的网络。但正如您所提到的,为了获得更好的结果,我仍然需要寻找最佳实践。
    猜你喜欢
    • 2015-08-18
    • 2021-12-12
    • 2020-11-18
    • 2020-09-22
    • 1970-01-01
    • 2019-08-03
    • 2020-04-28
    • 2020-07-03
    • 1970-01-01
    相关资源
    最近更新 更多