简单易懂的 pytorch 使用 DistributedDataParallel 进行单机多卡训练

最新推荐文章于 2025-03-28 12:21:25 发布

原创最新推荐文章于 2025-03-28 12:21:25 发布 · 920 阅读

1 ·

CC 4.0 BY-SA版权

文章标签：

#pytorch #深度学习 #python

各种解决方案同时被 2 个专栏收录

15 篇文章

订阅专栏

pytorch

7 篇文章

订阅专栏

本文介绍如何使用PyTorch的DistributedDataParallel (DDP)进行分布式训练。通过一个简单的模型示例，演示了初始化进程组、模型迁移至GPU、创建DDP模型实例、定义损失函数与优化器及执行前向与反向传播等关键步骤。

部署运行你感兴趣的模型镜像

首先放一个官方的案例，照着案例改就行

import torch
import torch.distributed as dist
import torch.nn as nn
import torch.optim as optim

from torch.nn.parallel import DistributedDataParallel as DDP

class ToyModel(nn.Module):
    def __init__(self):
        super(ToyModel, self).__init__()
        self.net1 = nn.Linear(10, 10)
        self.relu = nn.ReLU()
        self.net2 = nn.Linear(10, 5)

    def forward(self, x):
        return self.net2(self.relu(self.net1(x)))


def demo_basic():
    dist.init_process_group("nccl")
    rank = dist.get_rank()
    print(f"Start running basic DDP example on rank {rank}.")

    # create model and move it to GPU with id rank
    device_id = rank % torch.cuda.device_count()
    model = ToyModel().to(device_id)
    ddp_model = DDP(model, device_ids=[device_id])

    loss_fn = nn.MSELoss()
    optimizer = optim.SGD(ddp_model.parameters(), lr=0.001)

    optimizer.zero_grad()
    outputs = ddp_model(torch.randn(20, 10))
    labels = torch.randn(20, 5).to(device_id)
    loss_fn(outputs, labels).backward()
    optimizer.step()

if __name__ == "__main__":
    demo_basic()