pytorch 多GPU训练注意事项

最新推荐文章于 2022-11-18 02:11:04 发布

日作诗歌三千首

最新推荐文章于 2022-11-18 02:11:04 发布

阅读量373

点赞数

CC 4.0 BY-SA版权

本文链接：https://blog.youkuaiyun.com/u012483097/article/details/111922969

博客介绍了多GPU训练的两个注意点。一是在DataLoader中设置drop_last=True，丢弃最后一块数据，避免报错；二是若BN在多GPU要同步，需使用torch.nn.SyncBatchNorm.convert_sync_batchnorm(net).to(device_ids[0])，且要先初始化dist.init_process_group。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

1.多GPU训练记得DataLoader(dataset=dataset_train, batch_size=config['TRAIN']['BATCH'], shuffle=config['TRAIN']['SHUFFLE'], num_workers=config['TRAIN']['WORKERS'],drop_last=True)中的drop_last=True，把最后一块数据丢掉，不然最后报错。

2.如果BN在多GPU要同步，那么就要用torch.nn.SyncBatchNorm.convert_sync_batchnorm(net).to(device_ids[0])，并且要在这个代码前面，先初设化：dist.init_process_group('gloo', init_method='file:///tmp/somefile', rank=0, world_size=1)net = torch.nn.DataParallel(net, device_ids=device_ids)，具体情况如下

import torch.distributed as dist
dist.init_process_group('gloo', init_method='file:///tmp/somefile', rank=0, world_size=1)net = torch.nn.DataParallel(net, device_ids=device_ids)
if config["TRAIN"]["DATAPARALLEL"]["syncbatchnorm"]:
    net = torch.nn.SyncBatchNorm.convert_sync_batchnorm(net).to(device_ids[0])
else:
    net = net.cuda(device=device_ids[0])