<- Todos os termos

VRAM

A memória dedicada de uma GPU. Precisa conter os pesos do modelo, o KV cache de cada requisição em curso e as ativações. Quando esgota, você precisa de uma GPU maior, mais GPUs ou um modelo menor.

O que é

Orçamento aproximado dos pesos: ~2 bytes por parâmetro em precisão de 16 bits. Um modelo de 70B são ~140 GB em fp16, ~70 GB em int8, ~35 GB em int4 (ver quantization). Por cima vai o kv cache, que cresce com o contexto e a concorrência.

Por que importa

A VRAM, não o cômputo, costuma ser a primeira parede que você encontra ao fazer self-hosting. Decide qual GPU sozinha consegue rodar um modelo, e a quantos usuários consegue servir antes de precisar de paralelismo multi gpu.

Impacto em custo e infraestrutura

Cada degrau de VRAM aproximadamente dobra o preço por hora (24 GB -> 48 GB -> 80 GB -> 141 GB). A quantization é a forma principal de encaixar um modelo num degrau mais barato, ao custo de alguma qualidade.

Exemplo

Modelo, precisãoPesos (aprox.)
8B, fp16~16 GB
70B, fp16~140 GB
70B, int4~35 GB

Conceitos relacionados

Use no Obolith

Perguntas frequentes

Quanta VRAM preciso para rodar um modelo de 7B?

Cerca de 16 GB em fp16 para os pesos mais folga para o KV cache — uma placa de 24 GB fica confortável. Em 4 bits cabe em ~6-8 GB.

Última revisão: 2026-09-01