Janela de contexto
O número máximo de tokens que um modelo consegue considerar de uma vez — prompt e resposta somados. Os tamanhos comuns vão de 8K a mais de 1M de tokens.
O que é
A janela de contexto é a memória de trabalho do modelo, medida em tokens. Tudo sobre o que ele raciocina (prompt de sistema, histórico de chat, documentos recuperados, a pergunta atual e a resposta que está escrevendo) tem que caber dentro. Se passar, a requisição é rejeitada ou os tokens mais antigos são descartados.
Uma janela anunciada de 128K não significa 128K de entrada de graça: a resposta compete pelo mesmo orçamento, e alguns provedores reservam margem.
Por que importa
Uma janela maior deixa você pular a recuperação e colar os documentos direto — mais simples de construir, mas você paga entrada por cada token em cada chamada. Também aumenta a latência: o tempo até o primeiro token cresce com o tamanho do prompt porque o modelo precisa processar tudo antes de responder.
Impacto em custo e infraestrutura
O contexto grande é uma armadilha de custo quando os mesmos documentos são enviados de novo e de novo. Duas mitigações: o cache de prompt para um prefixo estável, e o RAG para enviar só os poucos milhares de tokens relevantes em vez de todo o corpus.
Alguns modelos (p. ex. Gemini) também cobram uma tarifa por token mais alta acima de um limite de contexto.
Exemplo
Colar um contrato de 50 páginas (~40K tokens) em cada pergunta de uma revisão de 20 turnos dá ~800K tokens de entrada na sessão. Recuperar 3 cláusulas relevantes por pergunta (~1,5K tokens) seria ~30K — uma redução de ~25×.
Conceitos relacionados
Use no Obolith
Perguntas frequentes
Uma janela de contexto maior deixa o modelo mais esperto?
Não diretamente. Ele pode conter mais informação, mas os modelos muitas vezes têm dificuldade de usar bem o meio de um contexto muito longo ("lost in the middle"). Um contexto relevante e focado costuma ganhar de um despejo grande.