Entrenamiento de LoRA personalizado en Flux 2: cómo ajustar tu propio modelo
Una guía práctica para entrenar un LoRA personalizado en Flux 2, desde la curación del dataset y el etiquetado de imágenes hasta los parámetros de entrenamiento, el seguimiento de la pérdida y la inferencia con tus pesos ajustados en cualquier plataforma.
Entrenar un LoRA personalizado sobre Flux 2-Dev es una de las cosas más potentes que puedes hacer con los modelos de difusión actuales. Ya quieras replicar un estilo artístico concreto, enseñarle al modelo a reconocer tu rostro o capturar un producto con una coherencia impecable al píxel, el ajuste fino con LoRA te da ese control sin gastar semanas y miles en un entrenamiento completo del modelo. El proceso se ha vuelto mucho más accesible en 2027, y este artículo te guía por cada paso, desde el dataset sin procesar hasta tu primera inferencia exitosa.
Qué hace realmente el entrenamiento de LoRA
LoRA, abreviatura de Low-Rank Adaptation, no vuelve a entrenar todo el modelo. Inserta pequeñas matrices de pesos entrenables en capas específicas del modelo base congelado, y solo entrena esas. El resultado es un archivo adaptador compacto, normalmente de entre 50 MB y 300 MB, que al cargarse junto al modelo base desplaza sus resultados hacia el estilo, el sujeto o el concepto con el que lo entrenaste.
LoRA frente a ajuste fino completo
Método
Tamaño del archivo
Costo de entrenamiento
Techo de calidad
Ajuste fino completo
10+ GB
Muy alto
Máximo
DreamBooth
2-8 GB
Alto
Alto
LoRA
50-300 MB
Bajo
Alto
LyCORIS
100-500 MB
Medio
Muy alto
La lógica económica es evidente. LoRA te permite iterar rápido, probar distintos datasets y compartir tus pesos entrenados sin compartir el modelo completo. Para la mayoría de creadores y desarrolladores, es la herramienta adecuada.
Por qué Flux 2 responde mejor
Las arquitecturas de difusión anteriores respondían de forma irregular al entrenamiento con LoRA. Conseguir una transferencia de estilo limpia con SDXL solía requerir cientos de imágenes cuidadosamente seleccionadas y varias sesiones de ajuste de hiperparámetros. Flux 2-Dev es fundamentalmente distinto. Su arquitectura de flow matching responde de forma más directa a las adaptaciones de bajo rango, lo que significa que puedes captar bien un concepto con tan solo 10 a 20 imágenes para una persona y con menos pasos de entrenamiento en total. El techo de calidad también es más alto: Flux 2-Pro y Flux 2-Max producen resultados mucho más nítidos y coherentes que sus predecesores cuando el LoRA se aplica correctamente.
Cómo construir tu dataset de entrenamiento
Tu dataset es el factor más importante del entrenamiento de LoRA personalizado. Los datos malos producen LoRA malos, y ninguna configuración de entrenamiento ingeniosa arregla un dataset roto.
Cantidad y calidad de las imágenes
Para la generación basada en sujetos (entrenar a una persona, personaje u objeto concreto):
Mínimo: 10 imágenes
Óptimo: 20 a 30 imágenes
Para entrenar un estilo: entre 50 y 150 imágenes funciona mejor
Cada imagen debe estar nítida y bien iluminada. Las fotos borrosas, los artefactos de compresión fuertes y las resoluciones mezcladas degradan la capacidad del LoRA para extraer el concepto con limpieza. Usa una resolución mínima de 512x512 píxeles; para los LoRA de Flux 2 se prefiere 1024x1024.
💡 La variedad importa más que la cantidad. Diez imágenes nítidas y variadas superan a cincuenta parecidas. Incluye distintos ángulos, condiciones de luz y fondos para evitar que tu LoRA fije un único contexto ambiental.
Cómo etiquetar bien tus imágenes
El etiquetado es donde la mayoría de los principiantes pierden calidad. Cada imagen de entrenamiento necesita un texto descriptivo que describa todo lo que aparece en ella excepto el concepto que estás enseñando. El concepto en sí debe representarse con una palabra disparadora única que todavía no exista en el vocabulario del modelo base.
Por ejemplo, al entrenar a una persona llamada Sarah:
Descripción débil: "Una foto de Sarah sonriendo"
Descripción sólida: "Una foto de sks persona sonriendo en un parque, luz cálida de la tarde, ropa casual"
La palabra disparadora sks (o cualquier token corto y único que elijas) se convierte en el ancla. Cuando más tarde escribas sks person en un prompt, el modelo entenderá exactamente qué persona concreta debe generar.
Herramientas para el etiquetado automático:
WD-1.4 Tagger para sujetos de anime y estilizados
BLIP-2 para sujetos fotorrealistas
LLaVA / Qwen-VL para descripciones detalladas de escenas
Qué evitar en tu dataset
Imágenes con marca de agua
Capturas de pantalla o imágenes con texto superpuesto
Imágenes con varios sujetos cuando entrenas un único sujeto
Recortes extremos o fondos demasiado uniformes
Más del 15 % de las imágenes procedentes de una única sesión de fotos
Los parámetros de entrenamiento adecuados
El entrenamiento de LoRA en Flux 2 es sensible a unos pocos parámetros clave. Acertar con ellos marca la diferencia entre un LoRA preciso y utilizable y uno borroso o sobreajustado.
El punto óptimo de la tasa de aprendizaje
La tasa de aprendizaje (LR) controla con qué intensidad cambian los pesos del modelo en cada paso de entrenamiento. Si es demasiado alta, tu LoRA se sobreajusta rápido. Si es demasiado baja, el modelo apenas responde a tus datos.
Tipo de LoRA
LR recomendada
Programador
Sujeto / persona
1e-4 a 4e-4
Coseno con reinicios
Estilo artístico
5e-5 a 2e-4
Constante con calentamiento
Objeto / producto
1e-4 a 3e-4
Coseno
Un programador de decaimiento coseno es la opción general más segura. Empieza con la LR que hayas fijado, decae de forma suave y evita las caídas bruscas que pueden desestabilizar el entrenamiento hacia los últimos pasos.
Pasos, rango y alfa
Los pasos de entrenamiento de los LoRA de Flux 2 suelen situarse entre 500 y 2000. Multiplica el número de imágenes por 100 como punto de partida aproximado (20 imágenes = 2000 pasos). Vigila la curva de pérdida y detente antes si se estabiliza o empieza a subir.
El rango de LoRA (escrito como r) controla la complejidad del adaptador:
Rango 4-8: pequeño, rápido, bueno para conceptos sencillos
Rango 16: equilibrado, funciona bien para la mayoría de sujetos
Rango 32-64: mayor captura de detalle, archivo más grande, entrenamiento más lento
El alfa controla el escalado efectivo de la tasa de aprendizaje. Una práctica habitual es fijar alfa igual al rango (alfa = 16 cuando el rango es 16), o la mitad del rango para una adaptación más sutil.
Tamaño de lote y resolución
Para la mayoría de configuraciones con GPU de consumo (RTX 3090 / RTX 4090 con 24 GB de VRAM):
Tamaño de lote: 1 a 4
Resolución: 1024x1024 (la resolución nativa de Flux 2)
Acumulación de gradientes: 4 pasos cuando el tamaño de lote es 1
Entrenar a 512 px ahorra VRAM, pero produce resultados notablemente más suaves. Flux 2 está optimizado para salidas de 1024 px, y los adaptadores LoRA entrenados a esa resolución funcionan significativamente mejor durante la inferencia.
Entrenar un LoRA de Flux 2: paso a paso
El marco de entrenamiento más usado para los LoRA de Flux 2 en 2027 es SimpleTuner, aunque kohya-ss/sd-scripts con la rama de Flux 2 también funciona bien para quienes ya conocen ese ecosistema.
Entrenar en una sola RTX 4090 con estos ajustes tarda entre 30 y 90 minutos, según el número de pasos y el tamaño del dataset.
Leer las curvas de pérdida
Las curvas de pérdida te dicen si tu LoRA está aprendiendo de verdad. En un entrenamiento sano:
La pérdida baja de forma brusca en los primeros 200 a 300 pasos
Luego se nivela y se estabiliza en un valor bajo y constante
Una pérdida que sigue bajando sin estabilizarse indica sobreajuste
💡 Guarda los checkpoints cada 250 a 500 pasos. El mejor LoRA rara vez está en el último paso. Prueba los checkpoints intermedios con unos pocos prompts para encontrar tu punto óptimo antes de que el modelo se sobreajuste.
Una pérdida de entrenamiento de entre 0,05 y 0,15 es típica en los LoRA de sujetos de Flux 2. Los LoRA de estilo suelen estabilizarse entre 0,08 y 0,20, según la distancia estilística respecto a la distribución de entrenamiento del modelo base.
Probar tu modelo ajustado
Primera prueba de inferencia
Una vez completado el entrenamiento, carga tu archivo LoRA .safetensors junto a Flux 2-Dev o Flux 2-Pro con el marco de inferencia que prefieras. Una configuración de ComfyUI o Automatic1111 con la extensión de Flux 2 lo gestiona directamente.
Empieza con un prompt sencillo que use tu palabra disparadora:
a portrait of sks person in a coffee shop, natural light, 85mm lens
Si el modelo genera una representación reconocible de tu sujeto entrenado, el LoRA funciona. Si los resultados son genéricos o irregulares, probablemente haya que revisar la colocación de la palabra disparadora o el etiquetado.
Palabras disparadoras que funcionan
Caso de uso
Ejemplo de colocación de la palabra disparadora
Persona
"una foto de sks persona"
Estilo artístico
"al estilo de myart"
Producto / objeto
"un producto brd sobre una mesa blanca"
Personaje
"mychar personaje de pie al aire libre"
Coloca siempre la palabra disparadora al principio del prompt y acompáñala de una descripción contextual clara. El modelo responde al contexto semántico completo que rodea la palabra disparadora, no solo al token en sí.
Cómo usar modelos LoRA en PicassoIA
PicassoIA te da acceso directo a modelos de Flux 2 con LoRA sin ninguna configuración local. Si quieres probar resultados de Flux 2 ajustados justo después de entrenar, la plataforma tiene varias opciones listas para usar.
Modelos compatibles con LoRA en la plataforma
Los modelos más relevantes para la generación basada en LoRA en PicassoIA son:
flux-dev-lora: la variante oficial de Flux Dev con soporte de LoRA integrado. Carga tus propios pesos de .safetensors directamente desde una URL de HuggingFace y ejecuta la inferencia al instante, sin necesidad de GPU por tu parte.
p-image-lora: una versión podada y optimizada del pipeline de Flux con soporte de adaptadores LoRA. Funciona más rápido sin una pérdida de calidad significativa, ideal para iterar rápido y probar varios checkpoints.
sdxl-multi-controlnet-lora: combina LoRA con condicionamiento multi-ControlNet para una generación estructurada y consciente de la pose a partir de la base SDXL.
También puedes usar Flux 2-Dev, Flux 2-Pro, Flux 2-Flex y Flux 2-Max para una inferencia base de alta calidad y evaluar la calidad de los resultados antes de desplegar tu LoRA de forma más amplia.
En el campo LoRA URL, pega la URL pública de HuggingFace de tu archivo LoRA de .safetensors entrenado
Ajusta LoRA Scale: empieza en 0,8 para una influencia fuerte y bájalo a 0,5 para una mezcla más sutil
Escribe tu prompt con la palabra disparadora incluida cerca del principio
Fija el guidance scale entre 3,5 y 4,5 (Flux 2 usa valores de guía más bajos que SDXL)
Genera y evalúa el resultado frente al concepto entrenado
💡 Consejo sobre LoRA Scale: un valor por encima de 1,0 tiende a sobresaturar el concepto y a producir artefactos. Mantente entre 0,6 y 0,9 en la mayoría de los casos.
Consejos para prompts con LoRA personalizados
Escribir prompts eficaces para un LoRA personalizado es distinto de la escritura de prompts estándar. Estas son algunas reglas que mejoran la calidad de forma constante:
Empieza con la palabra disparadora en la primera frase de tu prompt
Describe la situación, no solo el sujeto: "sks person hiking in golden hour forest light" da siempre mejores resultados que "sks person" escrito solo
Los prompts negativos siguen ayudando: "blurry, low quality, distorted face" reduce los artefactos incluso con el LoRA activo
El guidance scale importa: Flux 2 funciona mejor entre 3,5 y 5,0 para la inferencia con LoRA, más bajo de lo que quizá estés acostumbrado en los flujos de trabajo de SDXL
3 errores que arruinan la calidad del LoRA
1. Entrenar con imágenes demasiado parecidas. Si el 80 % de tus 20 imágenes se tomaron en la misma habitación con la misma luz, tu LoRA se sobreajusta a ese contexto. El modelo integra el entorno como parte del propio concepto. Varía de forma drástica los fondos, la iluminación y el encuadre a lo largo de tu dataset.
2. Saltarse la revisión de las descripciones. Muchos flujos de entrenamiento ofrecen etiquetado automático, y los usuarios confían en él sin revisar el resultado. Las descripciones automáticas suelen incluir los rasgos distintivos del sujeto en el texto en lugar de aislarlos en la palabra disparadora. Revisa y corrige a mano las descripciones antes de entrenar.
3. No probar los checkpoints intermedios. Los LoRA sobreajustados no fallan de golpe. Se degradan poco a poco a partir de cierto número de pasos. La versión del paso 1000 suele ser bastante mejor que la del paso 2000 en los LoRA de sujetos. Incorpora la evaluación de checkpoints en tu flujo de trabajo desde el principio.
💡 Prueba rápida de calidad: genera 5 imágenes con la palabra disparadora y prompts muy distintos. Un LoRA sólido mantiene el sujeto en las 5. Uno débil solo funciona cuando el prompt se parece mucho a las condiciones de tus imágenes de entrenamiento.
Crea algo que no se parezca a nada más
El entrenamiento de LoRA personalizado es la forma de dejar de usar la IA como una máquina genérica de imágenes y empezar a usarla como una herramienta que refleja tu visión creativa concreta. Ya sea tu estilo fotográfico, un personaje de ficción, una línea de productos o un rostro que el modelo nunca ha visto, el flujo de trabajo descrito te da todo lo necesario para lograrlo.
La colección de modelos compatibles con LoRA de PicassoIA, que incluye flux-dev-lora, p-image-lora y la familia completa de Flux 2, significa que puedes probar tus pesos entrenados al instante en la nube sin necesitar una GPU local de gama alta. Elige un modelo, carga tu LoRA, escribe tu palabra disparadora y mira qué hace el modelo con aquello con lo que lo entrenaste.
La mejor forma de dominar esto es entrenar algo, evaluarlo con honestidad, identificar dónde falla y volver a entrenarlo con mejores datos. Cada iteración revela algo que ningún recurso escrito puede replicar del todo.