<- Todos os termos

Multi-GPU

Repartir um modelo entre várias GPUs quando não cabe em uma. Adiciona custo e sobrecarga de comunicação, e precisa de uma interconexão rápida como NVLink para continuar eficiente.

O que é

O paralelismo de tensor divide as matrizes de cada camada entre GPUs que depois trocam resultados parciais a cada passo — rápido, mas só se as GPUs compartilharem um link de alta largura de banda (NVLink / NVSwitch). O paralelismo de pipeline coloca camadas diferentes em GPUs diferentes; mais barato de conectar, mas pode deixar GPUs ociosas esperando umas pelas outras.

Por que importa

Ir de 1 para 2 GPUs mais que dobra o custo (duas GPUs + interconexão + perda de coordenação). Encaixar o modelo numa única GPU via quantization quase sempre sai mais barato se a qualidade permitir.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal