QLoRA
LoRA par-dessus un modèle de base quantifié en 4 bits. Réduit la VRAM nécessaire au fine-tuning d'un facteur ~3-4, donc un modèle 70B se tune sur un seul GPU de 48 Go au lieu d'un nœud multi-GPU.
Ce que c'est
Les poids de base gelés sont stockés en 4 bits (style int4, souvent NF4). Ils sont dé-quantifiés en 16 bits à la volée, couche par couche, seulement pendant le calcul - le modèle complet n'est jamais en mémoire en pleine précision. L'adaptateur lora lui-même s'entraîne en 16 bits. La perte de qualité par rapport à LoRA classique est faible pour la plupart des tâches.
Pourquoi c'est important
QLoRA fait s'effondrer la barre matérielle pour fine-tuner un grand modèle. Ça change directement quel GPU tu loues (une carte, pas un nœud) et donc le coût d'un run - souvent de plus de moitié.