【发布时间】:2021-07-11 12:16:54
【问题描述】:
我正在尝试在 GCloud 中的 kubernetes 上运行一些 python 代码,我正在使用 pytorch,而对于基本映像,我正在使用 gcr.io/deeplearning-platform-release/pytorch-gpu/。
一切正常,我的模型训练但只使用 CPU。当我运行以下内容时
>>> import torch
>>> torch.cuda.is_available()
/opt/conda/lib/python3.7/site-packages/torch/cuda/__init__.py:52: UserWarning: CUDA initialization: CUDA driver initialization failed, you might not have a CUDA gpu. (Triggered internally at /opt/conda/conda-bld/pytorch_1614378098133/work/c10/cuda/CUDAFunctions.cpp:109.)
return torch._C._cuda_getDeviceCount() > 0
False
但这是 nvidia-smi 的输出
+-----------------------------------------------------------------------------+
| NVIDIA-SMI 418.67 Driver Version: 418.67 CUDA Version: 10.1 |
|-------------------------------+----------------------+----------------------+
| GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. |
|===============================+======================+======================|
| 0 Tesla K80 Off | 00000000:00:04.0 Off | 0 |
| N/A 62C P8 32W / 149W | 11MiB / 11441MiB | 0% Default |
+-------------------------------+----------------------+----------------------+
+-----------------------------------------------------------------------------+
| Processes: GPU Memory |
| GPU PID Type Process name Usage |
|=============================================================================|
| No running processes found |
+-----------------------------------------------------------------------------+
pytorch 的版本是由基础映像提供的版本,所以我不确定如何解决这个问题。任何帮助将不胜感激。
编辑:
>>> torch.__version__
'1.8.0'
编辑二:
>>> torch.version.cuda
'11.1'
【问题讨论】:
-
请用 PyTorch 版本更新问题:
torch.__version__ -
为了了解您的情况,我需要更多信息。您是否按照documentation 创建了一个实例组,每个实例都添加了 GPU?此外,在创建实例组后,您应该安装设备驱动程序。所以应用程序可以访问设备here。驱动安装了吗?
-
感谢您的回答。我自己没有创建节点池。只负责让这个工作。在节点池详细信息下,我可以看到 1 x NVIDIA Tesla K80 作为 gpu 加速器 pr 节点。
-
@Berriel 我已经更新了火炬版本
-
@Shadesfear 作为健全性检查,您能否提供
torch.version.cuda的输出?
标签: python-3.x kubernetes google-cloud-platform pytorch gcloud