【问题标题】:Pytorch 3-GPUs, just can only use 2 of them to trainPytorch 3-GPU,只能用其中 2 个来训练
【发布时间】:2018-10-31 07:51:51
【问题描述】:

我有3个1080TI,但是训练的时候只能用2个..

代码:

device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
model.cuda()

criterion = nn.CrossEntropyLoss().cuda()
optimizer_conv = optim.SGD(model.classifier.parameters(), lr=0.0001, momentum=0.9)
exp_lr_scheduler = lr_scheduler.StepLR(optimizer_conv, step_size=7, gamma=0.1)

火车部分:

outputs = nn.parallel.data_parallel(model,inputs,device_ids=[0,1,2])

使用“CUDA_VISIBLE_DEVICES="1,2,3" python train.py" 明白了:

| 22%   35C    P8    10W / 250W |     12MiB / 11178MiB |      0%  
| 43%   59C    P2    92W / 250W |   1169MiB / 11178MiB |     49%   
| 44%   60C    P2    91W / 250W |   1045MiB / 11175MiB |     54% 

使用 "CUDA_VISIBLE_DEVICES="0,1,2" python train.py" 明白了:

| 21%   38C    P2    95W / 250W |   1169MiB / 11178MiB |     78%      Default |  
| 42%   63C    P2    93W / 250W |    777MiB / 11178MiB |     76%      Default |  
| 43%   64C    P0    85W / 250W |    282MiB / 11175MiB |      0%      Default |

【问题讨论】:

  • this 可能感兴趣

标签: python deep-learning pytorch multi-gpu


【解决方案1】:

eeeee..我找到了原因:
当有 3 个 GPU 时,我的 batchsize = 4
所以改变batchsize更大可以解决这个“奇怪”的问题

【讨论】:

  • 我也遇到过,我也是这样。我有四个 GPU,其中 3 个 GPU 正在工作,但其中一个奇怪的是没有。我的批量大小也是 4。
猜你喜欢
  • 2019-09-01
  • 2022-12-11
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-07-04
  • 2020-11-29
  • 2021-03-03
  • 2021-03-08
相关资源
最近更新 更多