QLoRA
LoRA sobre un modelo base que se ha cuantizado a 4 bits. Reduce la VRAM necesaria para el fine-tuning en ~3-4×, así que un modelo de 70B se ajusta en una sola GPU de 48 GB en lugar de un nodo multi-GPU.
Qué es
Los pesos base congelados se guardan en 4 bits (estilo int4, normalmente NF4). Se descuantizan a 16 bits sobre la marcha, capa por capa, solo mientras se calcula, así que el modelo completo nunca está en memoria a precisión completa. El adaptador lora en sí se entrena en 16 bits. La pérdida de calidad frente a LoRA normal es pequeña para la mayoría de las tareas.
Por qué importa
QLoRA hunde el listón de hardware para hacer fine-tuning de un modelo grande. Eso cambia directamente qué GPU alquilas (una tarjeta, no un nodo) y por tanto el costo de una ejecución, a menudo en más de la mitad.