GPU
Un processeur à des milliers de cœurs parallèles et une mémoire embarquée très rapide. Le cheval de bataille de l'entraînement comme de l'inférence des grands modèles.
Ce que c'est
Pour un LLM, deux chiffres de GPU comptent surtout : la VRAM (le modèle rentre-t-il ?) et la bande passante mémoire (à quelle vitesse streamer les poids, ce qui fixe les tokens par seconde). Le calcul brut (TFLOPS) compte plus pour l'entraînement et le prefill que pour la génération.
Les cartes data-center (H100, H200, B200, MI300X) ont beaucoup de VRAM et de HBM ; les cartes grand public (RTX 4090, 5090) sont moins chères à l'heure mais ont moins de VRAM et pas d'interconnexion rapide.
Pourquoi c'est important
Le GPU est la plus grosse ligne d'un budget self hosting. En choisir un trop petit force le multi gpu ou la quantization ; trop gros gaspille de l'argent à faible utilisation.
Impact coût & infrastructure
Les prix de location d'un même GPU varient de 2 à 3x selon le fournisseur et entre on-demand et spot. Le prix à la GPU-heure est le nombre à comparer, pas le prix de l'instance.