Checkpoint frente a LoRA: ¿cuál es la diferencia?

Un checkpoint de modelo registra el estado del modelo en un momento determinado; en las comunidades de generación de imágenes, «checkpoint» suele referirse a un conjunto cargable de pesos completos del modelo. Una LoRA almacena una actualización aprendida mucho más pequeña que se aplica a un modelo base compatible. El checkpoint puede funcionar por sí solo en el flujo de destino; la LoRA no contiene ese modelo base.

Una retícula completa del modelo junto a una fina capa superpuesta de adaptador LoRA vinculada a un modelo base independiente.
Un checkpoint completo contiene un estado amplio del modelo. Una LoRA contiene una actualización específica y solo tiene sentido junto al modelo base para el que se entrenó.

«Checkpoint» tiene dos significados relacionados

Durante el entrenamiento, un checkpoint es un estado guardado desde el que puede evaluarse o reanudarse el trabajo. Puede incluir pesos del modelo, estado del optimizador, estado del planificador, estado del generador de números aleatorios y metadatos de entrenamiento. Un checkpoint de inferencia suele ser una exportación más ligera que contiene los pesos y la configuración necesarios para cargar un modelo y utilizarlo.

En las comunidades de Stable Diffusion, «checkpoint» también es una forma abreviada de referirse al archivo principal de un modelo seleccionado en una interfaz. Esto no garantiza que incluya todas las dependencias. Un flujo puede seguir necesitando un VAE, codificador de texto, tokenizador o configuración que facilite la aplicación o el paquete complementario. Define siempre «completo» en relación con el cargador que quieras recuperar.

Una LoRA es una actualización aprendida, no un segundo modelo completo

Low-Rank Adaptation mantiene congelados los pesos preentrenados y aprende una actualización de bajo rango para capas seleccionadas. Durante la inferencia, un framework puede aplicar dinámicamente esa actualización al modelo base o fusionarla en una copia derivada. El adaptador es pequeño porque almacena la actualización, no porque comprima en secreto todos los pesos del modelo base.

Esta dependencia es la diferencia fundamental entre checkpoint y LoRA. No se puede dar por hecho que una LoRA de estilo de retrato entrenada para una familia de Stable Diffusion funcione con otra arquitectura. Del mismo modo, un adaptador de modelo de lenguaje depende del modelo base y los módulos de destino descritos por su configuración.

Comparación práctica

PreguntaTipo checkpointLoRA
Qué almacenaEstado general del modelo; a veces, estado adicional de entrenamientoPesos y configuración del adaptador de bajo rango
¿Puede ejecutarse por sí solo?Suele poder cargarse como modelo principal en el flujo para el que se diseñóNo; necesita un modelo base y un cargador compatibles
Uso habitualModelo base, ajuste fino completo, hito o punto de reanudaciónEspecialización eficiente y adaptación de estilo, sujeto o tarea
AlmacenamientoNormalmente mucho mayor, porque representa mucho más estadoNormalmente mucho más pequeña, porque solo se aprenden las actualizaciones seleccionadas
Pregunta de recuperación¿Tengo el paquete completo o el estado de entrenamiento que necesito?¿Tengo el modelo base, la configuración del adaptador y los pesos compatibles exactos?

¿Fusionar una LoRA la convierte en un checkpoint?

Fusionar o incorporar un adaptador a un modelo base produce pesos derivados. Una herramienta puede guardar esos pesos en un archivo denominado habitualmente checkpoint, pero esa salida no es el modelo base original y no conserva necesariamente una separación limpia y reversible entre modelo base y adaptador. Las operaciones de coma flotante, la conversión de dtype y las decisiones de exportación pueden afectar al resultado.

Conserva el adaptador sin fusionar y el modelo base exacto cuando quieras cambiar la intensidad, combinar adaptadores o reproducir la fusión. Conserva también el artefacto fusionado cuando ese archivo de despliegue exacto tenga importancia operativa. No elimines los orígenes únicamente porque un archivo fusionado se haya cargado correctamente una vez.

Qué conservar durante el ajuste fino

Durante una ejecución activa, los checkpoints intermedios resultan útiles para evaluar y recuperarse de una interrupción. Cuando termine la ejecución, conserva los hitos que respondan a una pregunta real: el adaptador final elegido, uno o varios checkpoints comparativos justificables, la configuración, el código o comando de entrenamiento, la referencia del conjunto de datos y el registro de evaluación. La guía sobre checkpoints de entrenamiento de LoRA lo trata como una decisión de reproducibilidad y no como una orden general de «conservarlo todo».

Un adaptador final no es un estado de entrenamiento reanudable. Los pesos de LoRA exportados pueden bastar para la inferencia aunque omitan los estados del optimizador y del planificador necesarios para continuar el entrenamiento exactamente.

Archiva familias, no nombres de archivo aislados

Una familia LoRA útil incluye suficiente contexto para identificar y obtener el modelo base compatible. Cuando el modelo base sea raro, privado o se haya modificado localmente, consérvalo junto al adaptador. Una familia de checkpoints puede incluir componentes complementarios que el entorno de ejecución facilitó de forma invisible durante la primera carga.

Tensor Archive ayuda a conservar y verificar tensores locales seleccionados como una familia relacionada. No deduce la compatibilidad a partir de un nombre de archivo, no reconstruye estados de entrenamiento que falten ni convierte una LoRA en un modelo base independiente.

Continúa con el artefacto que tienes

Si la extensión del adaptador es lo que genera dudas, consulta qué contiene un archivo LoRA. Si estás eligiendo un método de entrenamiento, utiliza LoRA frente a QLoRA. Si la cuestión se debe a la falta de espacio, descubre cómo liberar espacio en disco sin cambiar los pesos de LoRA.

Fuentes

Mantén juntos el modelo base y sus adaptadores.Descarga gratuita ↓