Multi-GPU
Repartir un modelo entre varias GPU cuando no cabe en una. Añade costo y sobrecarga de comunicación, y necesita una interconexión rápida como NVLink para seguir siendo eficiente.
Qué es
El paralelismo de tensor divide las matrices de cada capa entre GPU que luego intercambian resultados parciales en cada paso: rápido, pero solo si las GPU comparten un enlace de alto ancho de banda (NVLink / NVSwitch). El paralelismo de pipeline pone capas distintas en GPU distintas; más barato de conectar, pero puede dejar GPU paradas esperándose entre sí.
Por qué importa
Pasar de 1 a 2 GPU más que duplica el costo (dos GPU + interconexión + pérdida de coordinación). Meter el modelo en una sola GPU mediante quantization casi siempre sale más barato si la calidad lo permite.