【问题标题】:pytorch Rnn.py RuntimeError: CUDNN_STATUS_INTERNAL_ERRORpytorch Rnn.py 运行时错误:CUDNN_STATUS_INTERNAL_ERROR
【发布时间】:2018-08-08 17:53:56
【问题描述】:

我收到如下所示的 CUDNN_STATUS_INTERNAL_ERROR 错误。

python train_v2.py

Traceback (most recent call last):
  File "train_v2.py", line 113, in <module>
    main()
  File "train_v2.py", line 74, in main
    model.cuda()
  File "/home/ahkim/Desktop/squad_vteam/src/model.py", line 234, in cuda
    self.network.cuda()
  File "/home/ahkim/anaconda3/envs/san/lib/python3.6/site-packages/torch/nn/modules/module.py", line 249, in cuda
    return self._apply(lambda t: t.cuda(device))
  File "/home/ahkim/anaconda3/envs/san/lib/python3.6/site-packages/torch/nn/modules/module.py", line 176, in _apply
    module._apply(fn)
  File "/home/ahkim/anaconda3/envs/san/lib/python3.6/site-packages/torch/nn/modules/module.py", line 176, in _apply
    module._apply(fn)
  File "/home/ahkim/anaconda3/envs/san/lib/python3.6/site-packages/torch/nn/modules/module.py", line 176, in _apply
    module._apply(fn)
  File "/home/ahkim/anaconda3/envs/san/lib/python3.6/site-packages/torch/nn/modules/rnn.py", line 112, in _apply
    self.flatten_parameters()
  File "/home/ahkim/anaconda3/envs/san/lib/python3.6/site-packages/torch/nn/modules/rnn.py", line 105, in flatten_parameters
    self.batch_first, bool(self.bidirectional))
RuntimeError: CUDNN_STATUS_INTERNAL_ERROR

我应该如何解决这个问题? 我尝试删除 .nv 但没有成功。


nvidia-smi

Wed Aug  8 10:56:29 2018
+-----------------------------------------------------------------------------+
| NVIDIA-SMI 390.67                 Driver Version: 390.67                    |
|-------------------------------+----------------------+----------------------+
| GPU  Name        Persistence-M| Bus-Id        Disp.A | Volatile Uncorr. ECC |
| Fan  Temp  Perf  Pwr:Usage/Cap|         Memory-Usage | GPU-Util  Compute M. |
|===============================+======================+======================|
|   0  GeForce GTX TIT...  Off  | 00000000:04:00.0 Off |                  N/A |
| 22%   21C    P8    15W / 250W |    125MiB / 12212MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+
|   1  GeForce GTX TIT...  Off  | 00000000:05:00.0 Off |                  N/A |
| 22%   24C    P8    14W / 250W |     11MiB / 12212MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+
|   2  GeForce GTX TIT...  Off  | 00000000:08:00.0 Off |                  N/A |
| 22%   23C    P8    14W / 250W |     11MiB / 12212MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+
|   3  GeForce GTX TIT...  Off  | 00000000:09:00.0 Off |                  N/A |
| 22%   23C    P8    15W / 250W |     11MiB / 12212MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+
|   4  GeForce GTX TIT...  Off  | 00000000:85:00.0 Off |                  N/A |
| 22%   24C    P8    14W / 250W |     11MiB / 12212MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+
|   5  GeForce GTX TIT...  Off  | 00000000:86:00.0 Off |                  N/A |
| 22%   23C    P8    15W / 250W |     11MiB / 12212MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+
|   6  GeForce GTX TIT...  Off  | 00000000:89:00.0 Off |                  N/A |
| 22%   21C    P8    15W / 250W |     11MiB / 12212MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+
|   7  GeForce GTX TIT...  Off  | 00000000:8A:00.0 Off |                  N/A |
| 22%   23C    P8    15W / 250W |     11MiB / 12212MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+

+-----------------------------------------------------------------------------+
| Processes:                                                       GPU Memory |
|  GPU       PID   Type   Process name                             Usage      |
|=============================================================================|
|    0      1603      C   /usr/bin/python                              114MiB |
+-----------------------------------------------------------------------------+

更新:

使用 Nvidia 运行相同的代码没有错误 Driver Version: 396.26 (cuda V9.1.85.torch.backends.cudnn.version(): 7102)。我在使用 Driver Version: 390.67 时遇到错误(cuda V9.1.85.torch.backends.cudnn.version(): 7102)

【问题讨论】:

  • 你有多少GPU? nvidia-smi 在你的机器上的输出是什么?
  • @RobertCrovella 我在服务器上有 8 个 GPU。我发布了nvidia-smi 结果。
  • 这可能需要完整的测试用例来确定问题所在。您想使用 5 个 GPU 有什么特别的原因吗?你有什么特别的原因不想使用 GPU 0 吗?如果您指定 CUDA_VISIBLE_DEVICES=0,1,2,3 ,您会收到类似的错误吗?为什么您在问题中删除了关于如何设置该变量的提及?
  • @RobertCrovella 因为即使不说CUDA_VISIBLE_DEVICES=0,1,2,3,我也遇到了同样的错误。
  • 好吧,您还没有指出您使用的是什么 CUDA 或 CUDNN 版本。 390.67 应该适用于 CUDA 9.0 或 CUDA 9.1。如果您使用的是 CUDA 9.2,是的,您需要 396.xx 或更新的驱动程序。

标签: cuda pytorch cudnn


【解决方案1】:

通过以下步骤解决。

  1. export LD_LIBRARY_PATH= "/usr/local/cuda-9.1/lib64"

  2. 由于 nfs 问题,pytoch 缓存不在 nfs 中。例如:

    $ rm ~/.nv -rf

    $ mkdir -p /tmp/$USER/.nv

    $ ln -s /tmp/$USER/.nv ~/.nv

【讨论】:

    【解决方案2】:

    去pytorch网站,选择满足你cuda版本的版本 https://pytorch.org/

    cu100 = cuda 10.0

    pip3 uninstall torch
    pip3 install https://download.pytorch.org/whl/cu100/torch-1.0.1.post2-cp36-cp36m-linux_x86_64.whl
    

    【讨论】:

      【解决方案3】:

      转到https://pytorch.org/ 复制“运行此命令:”框中的命令。不要选择任何东西,只需选择复制命令并粘贴到您正在使用的编辑器中。我希望它有效。对我来说,它工作正常。

      适用于 RTX 2070

      提示 1

      conda install pytorch torchvision cudatoolkit=10.2 -c pytorch
      

      提示 2

      conda install pytorch-nightly cudatoolkit=10.0 -c pytorch
      

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2020-09-15
        • 1970-01-01
        • 2018-02-02
        • 2020-03-19
        • 1970-01-01
        • 2020-10-05
        • 2022-01-25
        • 1970-01-01
        相关资源
        最近更新 更多