<- Todos os termos

Tokens de entrada

Os tokens que você envia ao modelo: prompt de sistema, histórico da conversa, contexto recuperado e a mensagem do usuário. Normalmente a metade mais barata da conta.

O que é

Tudo o que o modelo lê antes de responder, contado em tokens: o prompt de sistema, o histórico de chat completo que você reenvia a cada turno, os documentos que você cola para RAG e a última mensagem do usuário. Em conversas longas o histórico domina.

Por que importa

A entrada é cobrada à parte da saída e normalmente é 3-5× mais barata. Também tem um teto: o modelo recusa assim que entrada mais saída passariam da janela de contexto.

Impacto em custo e infraestrutura

O volume de entrada cresce a cada turno de conversa e a cada documento num prompt RAG, então é a parte que escala em silêncio. O cache de prompt pode cortar o custo do prefixo repetido (prompt de sistema, exemplos few-shot) em até ~90%.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal