<- Tous les termes

RAG (génération augmentée par récupération)

Répondre avec un LLM en récupérant d'abord des extraits pertinents de tes propres données pour les mettre dans le prompt. Moins cher et plus à jour que de tout mettre dans une énorme fenêtre de contexte.

Ce que c'est

Un pipeline RAG : découper les documents en chunks, les embedder, les stocker dans une base vectorielle. À la requête : embedder la question, récupérer les k chunks les plus proches, et les coller dans le prompt du LLM comme contexte.

Pourquoi c'est important

Le RAG garde le prompt du LLM petit - quelques milliers de tokens d'entrée au lieu d'un corpus entier - ce qui est en général bien moins cher qu'une fenêtre de contexte géante, et permet de mettre à jour la connaissance sans réentraîner.

Impact coût & infrastructure

Une stack RAG a quatre lignes de coût : les appels d'API LLM, un modèle d'embeddings, une base vectorielle, et du stockage objet pour les documents. Le LLM est en général le plus gros ; la base vectorielle est celle qui surprend.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable