Entrenamiento de LoRA personalizado en Flux 2: cómo ajustar tu propio modelo

Una guía práctica para entrenar un LoRA personalizado en Flux 2, desde la curación del dataset y el etiquetado de imágenes hasta los parámetros de entrenamiento, el seguimiento de la pérdida y la inferencia con tus pesos ajustados en cualquier plataforma.

Entrenamiento de LoRA personalizado en Flux 2: cómo ajustar tu propio modelo
Cristian Da Conceicao
Fundador de Picasso IA

Entrenar un LoRA personalizado sobre Flux 2-Dev es una de las cosas más potentes que puedes hacer con los modelos de difusión actuales. Ya quieras replicar un estilo artístico concreto, enseñarle al modelo a reconocer tu rostro o capturar un producto con una coherencia impecable al píxel, el ajuste fino con LoRA te da ese control sin gastar semanas y miles en un entrenamiento completo del modelo. El proceso se ha vuelto mucho más accesible en 2027, y este artículo te guía por cada paso, desde el dataset sin procesar hasta tu primera inferencia exitosa.

Qué hace realmente el entrenamiento de LoRA

LoRA, abreviatura de Low-Rank Adaptation, no vuelve a entrenar todo el modelo. Inserta pequeñas matrices de pesos entrenables en capas específicas del modelo base congelado, y solo entrena esas. El resultado es un archivo adaptador compacto, normalmente de entre 50 MB y 300 MB, que al cargarse junto al modelo base desplaza sus resultados hacia el estilo, el sujeto o el concepto con el que lo entrenaste.

LoRA frente a ajuste fino completo

MétodoTamaño del archivoCosto de entrenamientoTecho de calidad
Ajuste fino completo10+ GBMuy altoMáximo
DreamBooth2-8 GBAltoAlto
LoRA50-300 MBBajoAlto
LyCORIS100-500 MBMedioMuy alto

La lógica económica es evidente. LoRA te permite iterar rápido, probar distintos datasets y compartir tus pesos entrenados sin compartir el modelo completo. Para la mayoría de creadores y desarrolladores, es la herramienta adecuada.

Por qué Flux 2 responde mejor

Las arquitecturas de difusión anteriores respondían de forma irregular al entrenamiento con LoRA. Conseguir una transferencia de estilo limpia con SDXL solía requerir cientos de imágenes cuidadosamente seleccionadas y varias sesiones de ajuste de hiperparámetros. Flux 2-Dev es fundamentalmente distinto. Su arquitectura de flow matching responde de forma más directa a las adaptaciones de bajo rango, lo que significa que puedes captar bien un concepto con tan solo 10 a 20 imágenes para una persona y con menos pasos de entrenamiento en total. El techo de calidad también es más alto: Flux 2-Pro y Flux 2-Max producen resultados mucho más nítidos y coherentes que sus predecesores cuando el LoRA se aplica correctamente.

Preparación del dataset para el entrenamiento de LoRA

Cómo construir tu dataset de entrenamiento

Tu dataset es el factor más importante del entrenamiento de LoRA personalizado. Los datos malos producen LoRA malos, y ninguna configuración de entrenamiento ingeniosa arregla un dataset roto.

Cantidad y calidad de las imágenes

Para la generación basada en sujetos (entrenar a una persona, personaje u objeto concreto):

  • Mínimo: 10 imágenes
  • Óptimo: 20 a 30 imágenes
  • Para entrenar un estilo: entre 50 y 150 imágenes funciona mejor

Cada imagen debe estar nítida y bien iluminada. Las fotos borrosas, los artefactos de compresión fuertes y las resoluciones mezcladas degradan la capacidad del LoRA para extraer el concepto con limpieza. Usa una resolución mínima de 512x512 píxeles; para los LoRA de Flux 2 se prefiere 1024x1024.

💡 La variedad importa más que la cantidad. Diez imágenes nítidas y variadas superan a cincuenta parecidas. Incluye distintos ángulos, condiciones de luz y fondos para evitar que tu LoRA fije un único contexto ambiental.

Cómo etiquetar bien tus imágenes

El etiquetado es donde la mayoría de los principiantes pierden calidad. Cada imagen de entrenamiento necesita un texto descriptivo que describa todo lo que aparece en ella excepto el concepto que estás enseñando. El concepto en sí debe representarse con una palabra disparadora única que todavía no exista en el vocabulario del modelo base.

Por ejemplo, al entrenar a una persona llamada Sarah:

  • Descripción débil: "Una foto de Sarah sonriendo"
  • Descripción sólida: "Una foto de sks persona sonriendo en un parque, luz cálida de la tarde, ropa casual"

La palabra disparadora sks (o cualquier token corto y único que elijas) se convierte en el ancla. Cuando más tarde escribas sks person en un prompt, el modelo entenderá exactamente qué persona concreta debe generar.

Herramientas para el etiquetado automático:

  • WD-1.4 Tagger para sujetos de anime y estilizados
  • BLIP-2 para sujetos fotorrealistas
  • LLaVA / Qwen-VL para descripciones detalladas de escenas

Qué evitar en tu dataset

  • Imágenes con marca de agua
  • Capturas de pantalla o imágenes con texto superpuesto
  • Imágenes con varios sujetos cuando entrenas un único sujeto
  • Recortes extremos o fondos demasiado uniformes
  • Más del 15 % de las imágenes procedentes de una única sesión de fotos

Seguimiento del progreso del entrenamiento de LoRA en Flux 2

Los parámetros de entrenamiento adecuados

El entrenamiento de LoRA en Flux 2 es sensible a unos pocos parámetros clave. Acertar con ellos marca la diferencia entre un LoRA preciso y utilizable y uno borroso o sobreajustado.

El punto óptimo de la tasa de aprendizaje

La tasa de aprendizaje (LR) controla con qué intensidad cambian los pesos del modelo en cada paso de entrenamiento. Si es demasiado alta, tu LoRA se sobreajusta rápido. Si es demasiado baja, el modelo apenas responde a tus datos.

Tipo de LoRALR recomendadaProgramador
Sujeto / persona1e-4 a 4e-4Coseno con reinicios
Estilo artístico5e-5 a 2e-4Constante con calentamiento
Objeto / producto1e-4 a 3e-4Coseno

Un programador de decaimiento coseno es la opción general más segura. Empieza con la LR que hayas fijado, decae de forma suave y evita las caídas bruscas que pueden desestabilizar el entrenamiento hacia los últimos pasos.

Pasos, rango y alfa

Los pasos de entrenamiento de los LoRA de Flux 2 suelen situarse entre 500 y 2000. Multiplica el número de imágenes por 100 como punto de partida aproximado (20 imágenes = 2000 pasos). Vigila la curva de pérdida y detente antes si se estabiliza o empieza a subir.

El rango de LoRA (escrito como r) controla la complejidad del adaptador:

  • Rango 4-8: pequeño, rápido, bueno para conceptos sencillos
  • Rango 16: equilibrado, funciona bien para la mayoría de sujetos
  • Rango 32-64: mayor captura de detalle, archivo más grande, entrenamiento más lento

El alfa controla el escalado efectivo de la tasa de aprendizaje. Una práctica habitual es fijar alfa igual al rango (alfa = 16 cuando el rango es 16), o la mitad del rango para una adaptación más sutil.

Tamaño de lote y resolución

Para la mayoría de configuraciones con GPU de consumo (RTX 3090 / RTX 4090 con 24 GB de VRAM):

  • Tamaño de lote: 1 a 4
  • Resolución: 1024x1024 (la resolución nativa de Flux 2)
  • Acumulación de gradientes: 4 pasos cuando el tamaño de lote es 1

Entrenar a 512 px ahorra VRAM, pero produce resultados notablemente más suaves. Flux 2 está optimizado para salidas de 1024 px, y los adaptadores LoRA entrenados a esa resolución funcionan significativamente mejor durante la inferencia.

Comparación de resultados antes y después del ajuste fino con LoRA

Entrenar un LoRA de Flux 2: paso a paso

El marco de entrenamiento más usado para los LoRA de Flux 2 en 2027 es SimpleTuner, aunque kohya-ss/sd-scripts con la rama de Flux 2 también funciona bien para quienes ya conocen ese ecosistema.

Preparar el entorno

# Clone SimpleTuner
git clone https://github.com/bghira/SimpleTuner
cd SimpleTuner

# Create Python environment
python -m venv venv
source venv/bin/activate

# Install dependencies
pip install -r requirements.txt

Lo que necesitas:

  • Python 3.10 o superior
  • CUDA 12.1 o superior
  • Al menos 24 GB de VRAM (o acceso a Kaggle / Colab A100)
  • Los pesos del modelo base Flux 2-Dev descargados desde Hugging Face

Organización de un dataset personalizado de imágenes para el entrenamiento de LoRA

Ejecutar el proceso de entrenamiento

Crea un config.json en tu directorio de entrenamiento con estos ajustes como punto de partida:

{
  "model_type": "flux",
  "pretrained_model_name_or_path": "black-forest-labs/FLUX.1-dev",
  "output_dir": "./output/my-lora",
  "train_batch_size": 1,
  "gradient_accumulation_steps": 4,
  "learning_rate": 1e-4,
  "lr_scheduler": "cosine",
  "max_train_steps": 1500,
  "lora_rank": 16,
  "lora_alpha": 16,
  "resolution": 1024,
  "mixed_precision": "bf16"
}

Después, lanza el entrenamiento:

python train_network.py --config_file config.json

Entrenar en una sola RTX 4090 con estos ajustes tarda entre 30 y 90 minutos, según el número de pasos y el tamaño del dataset.

Ejecución de los comandos de entrenamiento de LoRA en la terminal

Leer las curvas de pérdida

Las curvas de pérdida te dicen si tu LoRA está aprendiendo de verdad. En un entrenamiento sano:

  • La pérdida baja de forma brusca en los primeros 200 a 300 pasos
  • Luego se nivela y se estabiliza en un valor bajo y constante
  • Una pérdida que sigue bajando sin estabilizarse indica sobreajuste

💡 Guarda los checkpoints cada 250 a 500 pasos. El mejor LoRA rara vez está en el último paso. Prueba los checkpoints intermedios con unos pocos prompts para encontrar tu punto óptimo antes de que el modelo se sobreajuste.

Una pérdida de entrenamiento de entre 0,05 y 0,15 es típica en los LoRA de sujetos de Flux 2. Los LoRA de estilo suelen estabilizarse entre 0,08 y 0,20, según la distancia estilística respecto a la distribución de entrenamiento del modelo base.

Probar tu modelo ajustado

Revisión de resultados generados con IA a partir de un LoRA personalizado

Primera prueba de inferencia

Una vez completado el entrenamiento, carga tu archivo LoRA .safetensors junto a Flux 2-Dev o Flux 2-Pro con el marco de inferencia que prefieras. Una configuración de ComfyUI o Automatic1111 con la extensión de Flux 2 lo gestiona directamente.

Empieza con un prompt sencillo que use tu palabra disparadora:

a portrait of sks person in a coffee shop, natural light, 85mm lens

Si el modelo genera una representación reconocible de tu sujeto entrenado, el LoRA funciona. Si los resultados son genéricos o irregulares, probablemente haya que revisar la colocación de la palabra disparadora o el etiquetado.

Palabras disparadoras que funcionan

Caso de usoEjemplo de colocación de la palabra disparadora
Persona"una foto de sks persona"
Estilo artístico"al estilo de myart"
Producto / objeto"un producto brd sobre una mesa blanca"
Personaje"mychar personaje de pie al aire libre"

Coloca siempre la palabra disparadora al principio del prompt y acompáñala de una descripción contextual clara. El modelo responde al contexto semántico completo que rodea la palabra disparadora, no solo al token en sí.

Cómo usar modelos LoRA en PicassoIA

PicassoIA te da acceso directo a modelos de Flux 2 con LoRA sin ninguna configuración local. Si quieres probar resultados de Flux 2 ajustados justo después de entrenar, la plataforma tiene varias opciones listas para usar.

Notas manuscritas sobre los parámetros de entrenamiento de LoRA

Modelos compatibles con LoRA en la plataforma

Los modelos más relevantes para la generación basada en LoRA en PicassoIA son:

  • flux-dev-lora: la variante oficial de Flux Dev con soporte de LoRA integrado. Carga tus propios pesos de .safetensors directamente desde una URL de HuggingFace y ejecuta la inferencia al instante, sin necesidad de GPU por tu parte.
  • p-image-lora: una versión podada y optimizada del pipeline de Flux con soporte de adaptadores LoRA. Funciona más rápido sin una pérdida de calidad significativa, ideal para iterar rápido y probar varios checkpoints.
  • sdxl-multi-controlnet-lora: combina LoRA con condicionamiento multi-ControlNet para una generación estructurada y consciente de la pose a partir de la base SDXL.

También puedes usar Flux 2-Dev, Flux 2-Pro, Flux 2-Flex y Flux 2-Max para una inferencia base de alta calidad y evaluar la calidad de los resultados antes de desplegar tu LoRA de forma más amplia.

Paso a paso: usar flux-dev-lora en PicassoIA

  1. Abre la página del modelo flux-dev-lora en PicassoIA
  2. En el campo LoRA URL, pega la URL pública de HuggingFace de tu archivo LoRA de .safetensors entrenado
  3. Ajusta LoRA Scale: empieza en 0,8 para una influencia fuerte y bájalo a 0,5 para una mezcla más sutil
  4. Escribe tu prompt con la palabra disparadora incluida cerca del principio
  5. Fija el guidance scale entre 3,5 y 4,5 (Flux 2 usa valores de guía más bajos que SDXL)
  6. Genera y evalúa el resultado frente al concepto entrenado

💡 Consejo sobre LoRA Scale: un valor por encima de 1,0 tiende a sobresaturar el concepto y a producir artefactos. Mantente entre 0,6 y 0,9 en la mayoría de los casos.

Consejos para prompts con LoRA personalizados

Escribir prompts eficaces para un LoRA personalizado es distinto de la escritura de prompts estándar. Estas son algunas reglas que mejoran la calidad de forma constante:

  • Empieza con la palabra disparadora en la primera frase de tu prompt
  • Describe la situación, no solo el sujeto: "sks person hiking in golden hour forest light" da siempre mejores resultados que "sks person" escrito solo
  • Los prompts negativos siguen ayudando: "blurry, low quality, distorted face" reduce los artefactos incluso con el LoRA activo
  • El guidance scale importa: Flux 2 funciona mejor entre 3,5 y 5,0 para la inferencia con LoRA, más bajo de lo que quizá estés acostumbrado en los flujos de trabajo de SDXL

Muestra de resultados de LoRA ajustados en un tablero de inspiración

3 errores que arruinan la calidad del LoRA

1. Entrenar con imágenes demasiado parecidas. Si el 80 % de tus 20 imágenes se tomaron en la misma habitación con la misma luz, tu LoRA se sobreajusta a ese contexto. El modelo integra el entorno como parte del propio concepto. Varía de forma drástica los fondos, la iluminación y el encuadre a lo largo de tu dataset.

2. Saltarse la revisión de las descripciones. Muchos flujos de entrenamiento ofrecen etiquetado automático, y los usuarios confían en él sin revisar el resultado. Las descripciones automáticas suelen incluir los rasgos distintivos del sujeto en el texto en lugar de aislarlos en la palabra disparadora. Revisa y corrige a mano las descripciones antes de entrenar.

3. No probar los checkpoints intermedios. Los LoRA sobreajustados no fallan de golpe. Se degradan poco a poco a partir de cierto número de pasos. La versión del paso 1000 suele ser bastante mejor que la del paso 2000 en los LoRA de sujetos. Incorpora la evaluación de checkpoints en tu flujo de trabajo desde el principio.

💡 Prueba rápida de calidad: genera 5 imágenes con la palabra disparadora y prompts muy distintos. Un LoRA sólido mantiene el sujeto en las 5. Uno débil solo funciona cuando el prompt se parece mucho a las condiciones de tus imágenes de entrenamiento.

Crea algo que no se parezca a nada más

Uso de la interfaz de generación con IA para probar un LoRA personalizado

El entrenamiento de LoRA personalizado es la forma de dejar de usar la IA como una máquina genérica de imágenes y empezar a usarla como una herramienta que refleja tu visión creativa concreta. Ya sea tu estilo fotográfico, un personaje de ficción, una línea de productos o un rostro que el modelo nunca ha visto, el flujo de trabajo descrito te da todo lo necesario para lograrlo.

La colección de modelos compatibles con LoRA de PicassoIA, que incluye flux-dev-lora, p-image-lora y la familia completa de Flux 2, significa que puedes probar tus pesos entrenados al instante en la nube sin necesitar una GPU local de gama alta. Elige un modelo, carga tu LoRA, escribe tu palabra disparadora y mira qué hace el modelo con aquello con lo que lo entrenaste.

La mejor forma de dominar esto es entrenar algo, evaluarlo con honestidad, identificar dónde falla y volver a entrenarlo con mejores datos. Cada iteración revela algo que ningún recurso escrito puede replicar del todo.

Compartir este artículo

Elige tu idioma