Fine-tuning
Poursuivre l'entraînement d'un modèle existant sur tes propres exemples pour l'adapter à une tâche, un style ou un format. Moins cher et plus rapide que partir de zéro ; reste un coût GPU payé une fois par run.
Ce que c'est
Tu prends un modèle de base pré-entraîné, tu lui donnes de quelques centaines à quelques centaines de milliers de paires entrée/sortie, et tu fais quelques passes d'entraînement (epochs). Les poids se déplacent vers tes données. Le résultat est un nouveau modèle que tu héberges ou que tu envoies à un fournisseur qui héberge les fine-tunes.
Deux grandes familles : fine-tuning complet (mise à jour de tous les poids - cher) et les méthodes efficaces en paramètres comme lora / qlora (mise à jour d'un petit greffon - cheap). La plupart des gens parlent de la seconde.
Pourquoi c'est important
Le fine-tuning est une alternative à un long prompt système + des exemples. Bien fait, il permet à un modèle plus petit et moins cher d'égaler un plus gros sur ta tâche précise - ce qui change ton coût par million de tokens pour de bon, pas juste une fois.
Fait pour la mauvaise raison (ajouter des connaissances - utilise plutôt le rag) il consomme du temps GPU pour peu de gain.
Impact coût & infrastructure
Coût = heures-GPU du run + stockage des poids obtenus + (si hébergé) une prime au token à l'inférence. Un run lora sur un modèle 7-8B coûte souvent de quelques dollars à quelques dizaines de dollars de temps GPU ; un fine-tuning complet d'un modèle 70B, des centaines à des milliers.
Modélise ton run avec le calculateur de coût de fine-tuning avant de louer quoi que ce soit.
Concepts liés
Sur Obolith
FAQ
Fine-tuning ou RAG ?
Le RAG pour donner au modèle des faits à consulter. Le fine-tuning pour changer son comportement - ton, format, suivi d’un style d’instruction de niche. Les deux se combinent bien.