RAG (génération augmentée par récupération)
Répondre avec un LLM en récupérant d'abord des extraits pertinents de tes propres données pour les mettre dans le prompt. Moins cher et plus à jour que de tout mettre dans une énorme fenêtre de contexte.
Ce que c'est
Un pipeline RAG : découper les documents en chunks, les embedder, les stocker dans une base vectorielle. À la requête : embedder la question, récupérer les k chunks les plus proches, et les coller dans le prompt du LLM comme contexte.
Pourquoi c'est important
Le RAG garde le prompt du LLM petit - quelques milliers de tokens d'entrée au lieu d'un corpus entier - ce qui est en général bien moins cher qu'une fenêtre de contexte géante, et permet de mettre à jour la connaissance sans réentraîner.
Impact coût & infrastructure
Une stack RAG a quatre lignes de coût : les appels d'API LLM, un modèle d'embeddings, une base vectorielle, et du stockage objet pour les documents. Le LLM est en général le plus gros ; la base vectorielle est celle qui surprend.