<- Todos os termos

Janela de contexto

O número máximo de tokens que um modelo consegue considerar de uma vez — prompt e resposta somados. Os tamanhos comuns vão de 8K a mais de 1M de tokens.

O que é

A janela de contexto é a memória de trabalho do modelo, medida em tokens. Tudo sobre o que ele raciocina (prompt de sistema, histórico de chat, documentos recuperados, a pergunta atual e a resposta que está escrevendo) tem que caber dentro. Se passar, a requisição é rejeitada ou os tokens mais antigos são descartados.

Uma janela anunciada de 128K não significa 128K de entrada de graça: a resposta compete pelo mesmo orçamento, e alguns provedores reservam margem.

Por que importa

Uma janela maior deixa você pular a recuperação e colar os documentos direto — mais simples de construir, mas você paga entrada por cada token em cada chamada. Também aumenta a latência: o tempo até o primeiro token cresce com o tamanho do prompt porque o modelo precisa processar tudo antes de responder.

Impacto em custo e infraestrutura

O contexto grande é uma armadilha de custo quando os mesmos documentos são enviados de novo e de novo. Duas mitigações: o cache de prompt para um prefixo estável, e o RAG para enviar só os poucos milhares de tokens relevantes em vez de todo o corpus.

Alguns modelos (p. ex. Gemini) também cobram uma tarifa por token mais alta acima de um limite de contexto.

Exemplo

Colar um contrato de 50 páginas (~40K tokens) em cada pergunta de uma revisão de 20 turnos dá ~800K tokens de entrada na sessão. Recuperar 3 cláusulas relevantes por pergunta (~1,5K tokens) seria ~30K — uma redução de ~25×.

Conceitos relacionados

Use no Obolith

Perguntas frequentes

Uma janela de contexto maior deixa o modelo mais esperto?

Não diretamente. Ele pode conter mais informação, mas os modelos muitas vezes têm dificuldade de usar bem o meio de um contexto muito longo ("lost in the middle"). Um contexto relevante e focado costuma ganhar de um despejo grande.

Última revisão: 2026-09-01 · conceito atemporal