Fenêtre de contexte
Le nombre maximum de tokens qu'un modèle peut traiter d'un coup - prompt et réponse combinés. De 8K à plus d'1M de tokens selon les modèles.
Ce que c'est
La fenêtre de contexte est la mémoire de travail du modèle, en tokens. Tout ce sur quoi il raisonne - prompt système, historique, documents récupérés, question, et la réponse en cours - doit y tenir. Au-delà, la requête est rejetée ou les plus vieux tokens sont coupés.
Une fenêtre annoncée à 128K ne veut pas dire 128K d'entrée gratuite : la réponse puise dans le même budget, et certains fournisseurs gardent une marge.
Pourquoi c'est important
Une grande fenêtre permet d'éviter le RAG et de coller les documents directement - plus simple à construire, mais tu paies l'entrée pour chaque token à chaque appel. Ça augmente aussi la latence : le temps jusqu'au premier token croît avec la longueur du prompt.
Impact coût & infrastructure
Le grand contexte est un piège à coûts quand les mêmes documents sont renvoyés en boucle. Deux parades : le cache de prompt pour un préfixe stable, et le RAG pour n'envoyer que les quelques milliers de tokens pertinents.
Certains modèles (ex. Gemini) facturent aussi un tarif au token plus élevé au-delà d'un seuil de contexte.
Exemple
Coller un contrat de 50 pages (~40K tokens) à chaque question d'une revue de 20 tours = ~800K tokens d'entrée pour la session. Récupérer 3 clauses pertinentes par question (~1,5K tokens) donnerait ~30K - un facteur ~25.
Concepts liés
Sur Obolith
FAQ
Une plus grande fenêtre rend-elle le modèle plus intelligent ?
Pas directement. Elle contient plus d'information, mais les modèles exploitent mal le milieu d'un très long contexte (« lost in the middle »). Un contexte pertinent et ciblé vaut souvent mieux qu'un gros bloc.