Tokens de entrada
Os tokens que você envia ao modelo: prompt de sistema, histórico da conversa, contexto recuperado e a mensagem do usuário. Normalmente a metade mais barata da conta.
O que é
Tudo o que o modelo lê antes de responder, contado em tokens: o prompt de sistema, o histórico de chat completo que você reenvia a cada turno, os documentos que você cola para RAG e a última mensagem do usuário. Em conversas longas o histórico domina.
Por que importa
A entrada é cobrada à parte da saída e normalmente é 3-5× mais barata. Também tem um teto: o modelo recusa assim que entrada mais saída passariam da janela de contexto.
Impacto em custo e infraestrutura
O volume de entrada cresce a cada turno de conversa e a cada documento num prompt RAG, então é a parte que escala em silêncio. O cache de prompt pode cortar o custo do prefixo repetido (prompt de sistema, exemplos few-shot) em até ~90%.