<- Tous les termes

Fenêtre de contexte

Le nombre maximum de tokens qu'un modèle peut traiter d'un coup - prompt et réponse combinés. De 8K à plus d'1M de tokens selon les modèles.

Ce que c'est

La fenêtre de contexte est la mémoire de travail du modèle, en tokens. Tout ce sur quoi il raisonne - prompt système, historique, documents récupérés, question, et la réponse en cours - doit y tenir. Au-delà, la requête est rejetée ou les plus vieux tokens sont coupés.

Une fenêtre annoncée à 128K ne veut pas dire 128K d'entrée gratuite : la réponse puise dans le même budget, et certains fournisseurs gardent une marge.

Pourquoi c'est important

Une grande fenêtre permet d'éviter le RAG et de coller les documents directement - plus simple à construire, mais tu paies l'entrée pour chaque token à chaque appel. Ça augmente aussi la latence : le temps jusqu'au premier token croît avec la longueur du prompt.

Impact coût & infrastructure

Le grand contexte est un piège à coûts quand les mêmes documents sont renvoyés en boucle. Deux parades : le cache de prompt pour un préfixe stable, et le RAG pour n'envoyer que les quelques milliers de tokens pertinents.

Certains modèles (ex. Gemini) facturent aussi un tarif au token plus élevé au-delà d'un seuil de contexte.

Exemple

Coller un contrat de 50 pages (~40K tokens) à chaque question d'une revue de 20 tours = ~800K tokens d'entrée pour la session. Récupérer 3 clauses pertinentes par question (~1,5K tokens) donnerait ~30K - un facteur ~25.

Concepts liés

Sur Obolith

FAQ

Une plus grande fenêtre rend-elle le modèle plus intelligent ?

Pas directement. Elle contient plus d'information, mais les modèles exploitent mal le milieu d'un très long contexte (« lost in the middle »). Un contexte pertinent et ciblé vaut souvent mieux qu'un gros bloc.

Dernière revue : 2026-09-01 · concept stable