Multi-GPU
Repartir um modelo entre várias GPUs quando não cabe em uma. Adiciona custo e sobrecarga de comunicação, e precisa de uma interconexão rápida como NVLink para continuar eficiente.
O que é
O paralelismo de tensor divide as matrizes de cada camada entre GPUs que depois trocam resultados parciais a cada passo — rápido, mas só se as GPUs compartilharem um link de alta largura de banda (NVLink / NVSwitch). O paralelismo de pipeline coloca camadas diferentes em GPUs diferentes; mais barato de conectar, mas pode deixar GPUs ociosas esperando umas pelas outras.
Por que importa
Ir de 1 para 2 GPUs mais que dobra o custo (duas GPUs + interconexão + perda de coordenação). Encaixar o modelo numa única GPU via quantization quase sempre sai mais barato se a qualidade permitir.