<- Todos os termos

Inferência

Rodar um modelo já treinado para obter uma resposta, em contraposição a treiná-lo. Divide-se numa fase de prefill (ler o prompt) e numa fase de decodificação (escrever a resposta um token de cada vez).

O que é

O prefill processa todo o prompt numa passada paralela e constrói o kv cache. O seu custo escala com o comprimento do prompt e fixa o tempo até o primeiro token.

A decodificação gera então a resposta um token de cada vez, e cada passo lê o KV cache que vai crescendo. É limitada pela largura de banda de memória e fixa os tokens por segundo.

Por que importa

A inferência é o que tanto uma conta de API quanto uma GPU auto-hospedada pagam. Entender as duas fases explica por que prompts longos demoram a arrancar, por que a velocidade de geração quase não depende do comprimento do prompt, e por que a concorrência é limitada pela VRAM.

Impacto em custo e infraestrutura

Numa GPU auto-hospedada, o custo por token é inteiramente função de quantos tokens/hora você empurra frente ao preço por hora (ver taxa de utilização e ponto de equilíbrio). Agrupar muitas requisições num batch é a forma principal de aumentar essa vazão.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal