<- Tous les termes

Multi-GPU

Répartir un modèle sur plusieurs GPU quand il ne rentre pas dans un seul. Ajoute du coût et de la communication, et exige une interconnexion rapide comme NVLink pour rester efficace.

Ce que c'est

Le tensor parallelism découpe les matrices de chaque couche entre GPU qui échangent des résultats partiels à chaque étape - rapide, mais seulement si les GPU partagent un lien haute bande passante (NVLink / NVSwitch). Le pipeline parallelism met des couches différentes sur des GPU différents ; moins cher à câbler, mais peut laisser des GPU au repos.

Pourquoi c'est important

Passer de 1 à 2 GPU fait plus que doubler le coût (deux GPU + interconnexion + perte de coordination). Faire rentrer le modèle sur un seul GPU via quantization est presque toujours moins cher si la qualité le permet.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable