【问题标题】:Torch doesnt see gpu on gcloud with deep learning containersTorch 没有看到带有深度学习容器的云上的 gpu
【发布时间】:2021-07-11 12:16:54
【问题描述】:

我正在尝试在 GCloud 中的 kubernetes 上运行一些 python 代码,我正在使用 pytorch,而对于基本映像,我正在使用 gcr.io/deeplearning-platform-release/pytorch-gpu/。

一切正常,我的模型训练但只使用 CPU。当我运行以下内容时

>>> import torch
>>> torch.cuda.is_available()
/opt/conda/lib/python3.7/site-packages/torch/cuda/__init__.py:52: UserWarning: CUDA    initialization: CUDA driver initialization failed, you might not have a CUDA gpu. (Triggered internally at  /opt/conda/conda-bld/pytorch_1614378098133/work/c10/cuda/CUDAFunctions.cpp:109.)
return torch._C._cuda_getDeviceCount() > 0
False

但这是 nvidia-smi 的输出

+-----------------------------------------------------------------------------+
| NVIDIA-SMI 418.67       Driver Version: 418.67       CUDA Version: 10.1     |
|-------------------------------+----------------------+----------------------+
| GPU  Name        Persistence-M| Bus-Id        Disp.A | Volatile Uncorr. ECC |
| Fan  Temp  Perf  Pwr:Usage/Cap|         Memory-Usage | GPU-Util  Compute M. |
|===============================+======================+======================|
|   0  Tesla K80           Off  | 00000000:00:04.0 Off |                    0 |
| N/A   62C    P8    32W / 149W |     11MiB / 11441MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+
                                                                               
+-----------------------------------------------------------------------------+
| Processes:                                                       GPU Memory |
|  GPU       PID   Type   Process name                             Usage      |
|=============================================================================|
|  No running processes found                                                 |
+-----------------------------------------------------------------------------+

pytorch 的版本是由基础映像提供的版本,所以我不确定如何解决这个问题。任何帮助将不胜感激。

编辑:

>>> torch.__version__
'1.8.0'

编辑二:

>>> torch.version.cuda
'11.1'

【问题讨论】:

  • 请用 PyTorch 版本更新问题:torch.__version__
  • 为了了解您的情况,我需要更多信息。您是否按照documentation 创建了一个实例组,每个实例都添加了 GPU?此外,在创建实例组后,您应该安装设备驱动程序。所以应用程序可以访问设备here。驱动安装了吗?
  • 感谢您的回答。我自己没有创建节点池。只负责让这个工作。在节点池详细信息下,我可以看到 1 x NVIDIA Tesla K80 作为 gpu 加速器 pr 节点。
  • @Berriel 我已经更新了火炬版本
  • @Shadesfear 作为健全性检查,您能否提供torch.version.cuda 的输出?

标签: python-3.x kubernetes google-cloud-platform pytorch gcloud


【解决方案1】:

问题是您有一个最高支持 CUDA 10.1 的 NVIDIA 驱动程序,并且您安装了基于 CUDA 11.1 构建的 PyTorch。要解决该问题,您可以:

  1. 将您的 NVIDIA 驱动程序更新为支持 CUDA 11.1 的驱动程序,或
  2. 安装与 CUDA 10.1 兼容的 PyTorch(与您的 NVIDIA 驱动程序兼容)

对于选项 2,您可以简单地运行以下命令:

pip install torch==1.8.0+cu101 torchvision==0.9.0+cu101 torchaudio==0.8.0 -f https://download.pytorch.org/whl/torch_stable.html

您可以在https://download.pytorch.org/whl/torch_stable.htmlcu101/ 中的那些)中查看可用于 CUDA 10.1 的版本

【讨论】:

    猜你喜欢
    • 2020-06-08
    • 1970-01-01
    • 2019-06-30
    • 2020-09-23
    • 2018-01-05
    • 2018-11-05
    • 2018-10-25
    • 2021-09-23
    • 2017-12-25
    相关资源
    最近更新 更多