<- Todos los términos

LoRA

Low-Rank Adaptation: un fine-tuning que congela el modelo base y en su lugar entrena un pequeño par de matrices por capa. ~0,1-1% de parámetros entrenables, así que cabe en una GPU y se ejecuta en minutos u horas.

Qué es

En lugar de actualizar una matriz de pesos W directamente, LoRA aprende dos matrices pequeñas A y B cuyo producto se suma a W en la inferencia: W + BA. A y B tienen un «rango» bajo (a menudo 8-64), así que juntas contienen una fracción diminuta de los parámetros. El modelo base sigue congelado.

La salida es un pequeño archivo «adaptador» (megabytes, no gigabytes). Puedes mantener varios adaptadores para un mismo modelo base e intercambiarlos por petición.

Por qué importa

LoRA es la razón de que el fine-tuning pasara de un presupuesto de laboratorio a uno de aficionado. Un modelo de 8B ajustado a una tarea, en una GPU alquilada por unos dólares, puede superar a una API de frontera en esa tarea concreta, y luego lo sirves tú mismo a tarifas de GPU-hora en lugar de tarifas por token.

Impacto en costo e infraestructura

VRAM necesaria ≈ pesos del modelo (en la precisión elegida) + un pequeño extra para el adaptador y los estados del optimizador: mucho menos que un fine-tuning completo. Un modelo de 8B en fp16 se ajusta con LoRA en una sola tarjeta de 24 GB; qlora lo baja aún más.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-04 · concepto atemporal