<- Todos los términos

VRAM

La memoria dedicada de una GPU. Tiene que contener los pesos del modelo, el KV cache de cada petición en curso y las activaciones. Cuando se agota, necesitas una GPU más grande, más GPU o un modelo más pequeño.

Qué es

Presupuesto aproximado de pesos: ~2 bytes por parámetro a precisión de 16 bits. Un modelo de 70B son ~140 GB en fp16, ~70 GB en int8, ~35 GB en int4 (ver quantization). Encima va el kv cache, que crece con el contexto y la concurrencia.

Por qué importa

La VRAM, no el cómputo, suele ser el primer muro que te encuentras al hacer self-hosting. Decide qué GPU sola puede ejecutar un modelo, y a cuántos usuarios puede servir antes de necesitar paralelismo multi gpu.

Impacto en costo e infraestructura

Cada escalón de VRAM aproximadamente duplica el precio por hora (24 GB -> 48 GB -> 80 GB -> 141 GB). La quantization es la forma principal de meter un modelo en un escalón más barato, a cambio de algo de calidad.

Ejemplo

Modelo, precisiónPesos (aprox.)
8B, fp16~16 GB
70B, fp16~140 GB
70B, int4~35 GB

Conceptos relacionados

Úsalo en Obolith

Preguntas frecuentes

¿Cuánta VRAM necesito para ejecutar un modelo de 7B?

Unos 16 GB en fp16 para los pesos más margen para el KV cache: una tarjeta de 24 GB va cómoda. A 4 bits cabe en ~6-8 GB.

Última revisión: 2026-09-01