VRAM
A memória dedicada de uma GPU. Precisa conter os pesos do modelo, o KV cache de cada requisição em curso e as ativações. Quando esgota, você precisa de uma GPU maior, mais GPUs ou um modelo menor.
O que é
Orçamento aproximado dos pesos: ~2 bytes por parâmetro em precisão de 16 bits. Um modelo de 70B são ~140 GB em fp16, ~70 GB em int8, ~35 GB em int4 (ver quantization). Por cima vai o kv cache, que cresce com o contexto e a concorrência.
Por que importa
A VRAM, não o cômputo, costuma ser a primeira parede que você encontra ao fazer self-hosting. Decide qual GPU sozinha consegue rodar um modelo, e a quantos usuários consegue servir antes de precisar de paralelismo multi gpu.
Impacto em custo e infraestrutura
Cada degrau de VRAM aproximadamente dobra o preço por hora (24 GB -> 48 GB -> 80 GB -> 141 GB). A quantization é a forma principal de encaixar um modelo num degrau mais barato, ao custo de alguma qualidade.
Exemplo
| Modelo, precisão | Pesos (aprox.) |
| 8B, fp16 | ~16 GB |
| 70B, fp16 | ~140 GB |
| 70B, int4 | ~35 GB |
Conceitos relacionados
Use no Obolith
Perguntas frequentes
Quanta VRAM preciso para rodar um modelo de 7B?
Cerca de 16 GB em fp16 para os pesos mais folga para o KV cache — uma placa de 24 GB fica confortável. Em 4 bits cabe em ~6-8 GB.