Inferencia
Ejecutar un modelo ya entrenado para obtener una respuesta, en contraposición a entrenarlo. Se divide en una fase de prefill (leer el prompt) y una fase de decodificación (escribir la respuesta un token cada vez).
Qué es
El prefill procesa todo el prompt en una pasada paralela y construye el kv cache. Su costo escala con la longitud del prompt y fija el tiempo hasta el primer token.
La decodificación genera luego la respuesta un token cada vez, y cada paso lee el KV cache que va creciendo. Está limitada por el ancho de banda de memoria y fija los tokens por segundo.
Por qué importa
La inferencia es lo que paga tanto una factura de API como una GPU autoalojada. Entender las dos fases explica por qué los prompts largos tardan en arrancar, por qué la velocidad de generación apenas depende de la longitud del prompt, y por qué la concurrencia está limitada por la VRAM.
Impacto en costo e infraestructura
En una GPU autoalojada, el costo por token es enteramente función de cuántos tokens/hora empujas frente al precio por hora (ver tasa de utilización y punto de equilibrio). Agrupar muchas peticiones en un batch es la forma principal de subir ese rendimiento.