<- Tous les termes

LoRA

Low-Rank Adaptation : un fine-tuning qui gèle le modèle de base et entraîne à la place une petite paire de matrices par couche. ~0,1-1 % de paramètres entraînables, donc ça tient sur un seul GPU et tourne en minutes à heures.

Ce que c'est

Au lieu de mettre à jour une matrice de poids W directement, LoRA apprend deux petites matrices A et B dont le produit est ajouté à W à l'inférence : W + BA. A et B ont un « rang » faible (souvent 8-64), donc ensemble elles ne contiennent qu'une infime fraction des paramètres. Le modèle de base reste gelé.

Le résultat est un petit fichier « adaptateur » (des mégaoctets, pas des gigaoctets). Tu peux garder plusieurs adaptateurs pour un même modèle de base et les permuter par requête.

Pourquoi c'est important

LoRA est la raison pour laquelle le fine-tuning est passé d'un budget de labo à un budget de hobbyiste. Un modèle 8B ajusté à une tâche, sur un GPU loué pour quelques dollars, peut battre une API frontière sur cette tâche - et tu le sers ensuite toi-même au tarif GPU-heure plutôt qu'au tarif au token.

Impact coût & infrastructure

VRAM nécessaire ≈ poids du modèle (dans la précision choisie) + un petit surcoût pour l'adaptateur et les états de l'optimiseur - bien moins qu'un fine-tuning complet. Un modèle 8B en fp16 se LoRA-tune sur une seule carte 24 Go ; qlora baisse encore ça.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-04 · concept stable