Fine-tuning completo
Un fine-tuning que actualiza todos los pesos del modelo, no un pequeño adaptador. El techo de calidad más alto, pero necesita varias veces el tamaño del modelo en VRAM y normalmente un nodo multi-GPU.
Qué es
Cada parámetro es entrenable. Además de los pesos hay que mantener los gradientes y el estado del optimizador (con Adam, otra vez ~2× los pesos), así que la VRAM pico es más o menos 4× el tamaño del modelo en fp16 antes de la memoria de activaciones. Un modelo de 70B necesita ~8 GPU de 80 GB; técnicas como ZeRO / FSDP reparten esto entre el nodo.
Por qué importa
El fine-tuning completo merece la pena cuando un adaptador lora se estanca por debajo de tu listón de calidad: cambio de comportamiento profundo, un idioma nuevo, una distribución de salida muy distinta. Para la mayoría de las tareas de negocio, LoRA/QLoRA te llevan ahí por la décima parte del costo.