【问题标题】:CNTK: cuDNN failure 7: CUDNN_STATUS_MAPPING_ERRORCNTK:cuDNN 故障 7:CUDNN_STATUS_MAPPING_ERROR
【发布时间】:2017-03-02 13:16:24
【问题描述】:

我正在尝试创建一个从 224 * 244 * 3 图像到 56 * 56 * 3 张量的简单卷积,我想将其与另一张图像进行比较。

为此,我创建了一个复合阅读器

scale = ImageDeserializer.scale(width=224,
                                height=224,
                                channels=3,
                                scale_mode="pad",
                                pad_value=114,
                                interpolations='linear')
scale2 = ImageDeserializer.scale(width=56,
                                 height=56,
                                 channels=3,
                                 scale_mode="pad",
                                 pad_value=114,
                                 interpolations='linear')
image_source = ImageDeserializer(os.path.join(path, "images_map.txt"))
image_source.ignore_labels()
image_source.map_features('features', [scale])

mask_source = ImageDeserializer(os.path.join(path, "images_mask_map.txt"))
mask_source.ignore_labels()
mask_source.map_features('mask', [scale2])

return MinibatchSource([image_source, mask_source])

并与该阅读器一起创建输入地图

input_map = {
    input_var: reader_train["features"],
    input_var_mask: reader_train["mask"]
}

cnn 是这样的

conv1 = cntk.layers.Convolution((5, 5), filterdims[0], pad=True, activation=cntk.ops.relu)(input_var)
maxpool1 = cntk.layers.MaxPooling((2, 2), (2, 2))(conv1)
conv2 = cntk.layers.Convolution((4, 4), filterdims[1], pad=True, activation=cntk.ops.relu)(maxpool1)
maxpool2 = cntk.layers.MaxPooling((2, 2), (2, 2))(conv2)
conv3 = cntk.layers.Convolution((4, 4), 3, pad=True, activation=cntk.ops.relu)(maxpool2)
return conv3 # shape is (3, 56, 56) conv3 = z in the error equation

有输入

input_var = cntk.ops.input_variable((3, 224, 224), np.float32)
input_var_mask = cntk.ops.input_variable((3, 56, 56), np.float32)

和误差函数

f2 = cntk.ops.element_times(cntk.ops.constant(0.00390625), input_var_mask, name="f2")
err = cntk.ops.reshape(cntk.ops.minus(z, f2), (56 * 56 * 3))
sq_err = cntk.ops.element_times(err, err)
mse = cntk.ops.reduce_mean(sq_err)
rmse_loss = cntk.ops.sqrt(mse)
rmse_eval = cntk.ops.sqrt(mse)

当我训练它时一切正常,直到

 data = reader_train.next_minibatch(min(minibatch_size, epoch_size - sample_count), input_map=input_map)  # fetch minibatch.
 trainer.train_minibatch(data)  # Error as in title 

我在哪里得到的

cuDNN failure 7: CUDNN_STATUS_MAPPING_ERROR ; GPU=0 ; hostname=STEPHENPC
train_minibatch_overload_for_minibatchdata

return _cntk_py.Trainer_train_minibatch_overload_for_minibatchdata(self, *args)
RuntimeError: cuDNN failure 7: CUDNN_STATUS_MAPPING_ERROR ; GPU=0 ;      hostname=STEPHENPC ; expr=err

cudaStreamDestroy failed (PrefetchGPUDataTransferer dtor): an illegal  memory access was encountered (cuda error 77)

有人可以帮我告诉我错误的原因吗?

提前致谢

【问题讨论】:

  • 您是否使用(或拥有)多个 GPU?
  • 我们还遇到了各种奇怪的 TensortRT 错误(例如 CUDNN_STATUS_MAPPING_ERROR)。当只使用一个 CPU 线程时,这些就消失了。 cuDNN 的文档中提到了类似的内容。

标签: python machine-learning computer-vision cntk


【解决方案1】:

根据遇到此问题的其他项目(例如参见 here),这可能表明 cudnn 库中存在错误。 CNTK 不使用纹理内存,因此最好将此问题报告给 NVidia。

【讨论】:

    猜你喜欢
    • 2015-12-05
    • 2018-07-14
    • 1970-01-01
    • 2010-10-09
    • 1970-01-01
    • 1970-01-01
    • 2016-09-09
    • 1970-01-01
    • 2013-09-29
    相关资源
    最近更新 更多