VRAM
La memoria dedicada de una GPU. Tiene que contener los pesos del modelo, el KV cache de cada petición en curso y las activaciones. Cuando se agota, necesitas una GPU más grande, más GPU o un modelo más pequeño.
Qué es
Presupuesto aproximado de pesos: ~2 bytes por parámetro a precisión de 16 bits. Un modelo de 70B son ~140 GB en fp16, ~70 GB en int8, ~35 GB en int4 (ver quantization). Encima va el kv cache, que crece con el contexto y la concurrencia.
Por qué importa
La VRAM, no el cómputo, suele ser el primer muro que te encuentras al hacer self-hosting. Decide qué GPU sola puede ejecutar un modelo, y a cuántos usuarios puede servir antes de necesitar paralelismo multi gpu.
Impacto en costo e infraestructura
Cada escalón de VRAM aproximadamente duplica el precio por hora (24 GB -> 48 GB -> 80 GB -> 141 GB). La quantization es la forma principal de meter un modelo en un escalón más barato, a cambio de algo de calidad.
Ejemplo
| Modelo, precisión | Pesos (aprox.) |
| 8B, fp16 | ~16 GB |
| 70B, fp16 | ~140 GB |
| 70B, int4 | ~35 GB |
Conceptos relacionados
Úsalo en Obolith
Preguntas frecuentes
¿Cuánta VRAM necesito para ejecutar un modelo de 7B?
Unos 16 GB en fp16 para los pesos más margen para el KV cache: una tarjeta de 24 GB va cómoda. A 4 bits cabe en ~6-8 GB.