<- Tous les termes

QLoRA

LoRA par-dessus un modèle de base quantifié en 4 bits. Réduit la VRAM nécessaire au fine-tuning d'un facteur ~3-4, donc un modèle 70B se tune sur un seul GPU de 48 Go au lieu d'un nœud multi-GPU.

Ce que c'est

Les poids de base gelés sont stockés en 4 bits (style int4, souvent NF4). Ils sont dé-quantifiés en 16 bits à la volée, couche par couche, seulement pendant le calcul - le modèle complet n'est jamais en mémoire en pleine précision. L'adaptateur lora lui-même s'entraîne en 16 bits. La perte de qualité par rapport à LoRA classique est faible pour la plupart des tâches.

Pourquoi c'est important

QLoRA fait s'effondrer la barre matérielle pour fine-tuner un grand modèle. Ça change directement quel GPU tu loues (une carte, pas un nœud) et donc le coût d'un run - souvent de plus de moitié.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-04 · concept stable