GPU
Un procesador con miles de núcleos en paralelo y memoria muy rápida en el mismo paquete. El caballo de batalla tanto del entrenamiento como de la inferencia de modelos grandes.
Qué es
Para trabajar con LLM, dos números de la GPU son los que más importan: cuánta VRAM tiene (¿cabe el modelo?) y su ancho de banda de memoria (a qué velocidad puede transmitir los pesos, lo que fija los tokens por segundo). El cómputo bruto (TFLOPS) importa más para el entrenamiento y el prefill que para la generación.
Las piezas de centro de datos (H100, H200, B200, MI300X) tienen mucha VRAM y HBM; las de consumo (RTX 4090, 5090) son más baratas por hora pero tienen menos VRAM y ninguna interconexión rápida.
Por qué importa
La GPU es la mayor línea de un presupuesto de self hosting. Elegir una demasiado pequeña obliga a multi gpu o a cuantizar; demasiado grande malgasta dinero con utilización baja.
Impacto en costo e infraestructura
Los precios de alquiler de la misma GPU varían 2-3× entre proveedores y entre on-demand y spot. El número que hay que comparar es el precio por GPU-hora, no el precio de la instancia.