Multi-GPU
Répartir un modèle sur plusieurs GPU quand il ne rentre pas dans un seul. Ajoute du coût et de la communication, et exige une interconnexion rapide comme NVLink pour rester efficace.
Ce que c'est
Le tensor parallelism découpe les matrices de chaque couche entre GPU qui échangent des résultats partiels à chaque étape - rapide, mais seulement si les GPU partagent un lien haute bande passante (NVLink / NVSwitch). Le pipeline parallelism met des couches différentes sur des GPU différents ; moins cher à câbler, mais peut laisser des GPU au repos.
Pourquoi c'est important
Passer de 1 à 2 GPU fait plus que doubler le coût (deux GPU + interconnexion + perte de coordination). Faire rentrer le modèle sur un seul GPU via quantization est presque toujours moins cher si la qualité le permet.