La primera vez que escribes un prompt en un generador de imágenes con IA y en segundos aparece algo fotorrealista, es fácil olvidar que el modelo que hace ese trabajo no siempre fue tan capaz. Empezó como una pizarra en blanco, miles de millones de números aleatorios, y se fue moldeando hasta convertirse en algo útil mediante un proceso que duró meses, miles de GPU y petabytes de datos. Ese proceso se llama entrenamiento y, en el caso de los modelos de IA de código abierto, es un proceso que cualquiera puede, en principio, replicar, inspeccionar o ampliar.
Este artículo explica paso a paso cómo se entrenan los modelos de IA de código abierto, desde la recopilación de datos brutos hasta que los pesos finales pasan a manos de la comunidad.
Qué significa realmente "entrenar"
El modelo parte de cero
Antes de empezar el entrenamiento, una red neuronal no es más que una gran colección de parámetros numéricos llamados pesos. Al inicializarse, esos pesos suelen ser aleatorios. La red no sabe cómo es un gato, qué significa la gramática ni cómo predecir el siguiente píxel de una imagen. Todo eso llega con la exposición a los datos.
Entrenar consiste en ajustar esos pesos durante millones de iteraciones hasta que el modelo produce resultados útiles de forma fiable. Piensa en ello como aprender por repetición, solo que en lugar de un cerebro humano, el "aprendiz" es una función matemática con miles de millones de perillas ajustables.
Los datos lo son todo
El ingrediente más importante del entrenamiento no es la arquitectura ni el hardware. Son los datos. Un modelo solo es tan bueno como lo que le han mostrado. Si el conjunto de datos está sesgado, incompleto o es de baja calidad, esos defectos quedan grabados directamente en el comportamiento del modelo.
En el caso de los modelos de generación de imágenes como Flux Dev o Stable Diffusion, los datos de entrenamiento consisten en cientos de millones de pares imagen-texto: una foto de un atardecer emparejada con el pie "hora dorada sobre el océano", y así sucesivamente. El modelo aprende a asociar contenido visual con lenguaje al ver suficientes de estos pares.

De dónde salen los datos
Rastreos web y conjuntos de datos con licencia
La mayor parte de los datos de entrenamiento de los grandes modelos de IA de código abierto procede de rastreos web. Proyectos como Common Crawl extraen miles de millones de páginas web y ponen esos datos a disposición de la investigación y de usos comerciales. En concreto, para los modelos de imagen, conjuntos de datos como LAION-5B reunieron pares imagen-texto de todo internet, y ofrecieron el material bruto para entrenar modelos a gran escala.
Junto a los rastreos web públicos, las organizaciones usan cada vez más conjuntos de datos con licencia procedentes de bibliotecas de fotos de archivo, publicaciones científicas y repositorios curados. Esto importa más que nunca, a medida que cambia el panorama legal en torno a los datos de entrenamiento.
Nota: No todos los datos que se encuentran en internet están disponibles legalmente para entrenar modelos. Los modelos de código abierto varían mucho en su transparencia sobre el origen de los datos, y esa falta de transparencia crece a medida que aumentan los litigios.
La calidad supera al volumen
Los conjuntos de datos más grandes no producen automáticamente mejores modelos. Investigadores de Stability AI y Black Forest Labs (el equipo detrás de Flux Schnell y Flux Pro) han comprobado con regularidad que filtrar imágenes de baja calidad, eliminar duplicados y equilibrar la representación de los sujetos produce resultados muy superiores a limitarse a añadir más datos.
La curación de datos es una disciplina en sí misma. Equipos de anotadores y pipelines de filtrado automatizados dedican mucho esfuerzo a asegurar que lo que entra en el ciclo de entrenamiento merezca de verdad ser entrenado.

El ciclo de entrenamiento, paso a paso
Pase hacia delante, predicciones y pérdida
Una vez preparados los datos, el entrenamiento se ejecuta en un bucle continuo. En cada iteración, el modelo recibe un lote de ejemplos de entrenamiento y produce predicciones. En un modelo de generación de imágenes, esto puede significar: dada una versión con ruido de una imagen y un prompt de texto, predecir cómo era la imagen original y limpia.
La diferencia entre la predicción del modelo y la respuesta correcta se mide mediante una función de pérdida. La pérdida es un único número: cuanto más bajo, mejor lo ha hecho el modelo; cuanto más alto, peor. Al principio del entrenamiento, la pérdida es alta porque los pesos siguen siendo prácticamente aleatorios. El objetivo de todo el entrenamiento es hacer bajar ese número de forma constante a lo largo de millones de iteraciones.
Retropropagación en lenguaje sencillo
Una vez calculada la pérdida, el modelo tiene que averiguar qué pesos contribuyeron al error y en qué medida. Esto se hace mediante la retropropagación, un algoritmo que recorre la red hacia atrás, capa por capa, y calcula el gradiente de la pérdida respecto a cada peso.
Un gradiente es una dirección y una magnitud: indica si aumentar o disminuir un peso concreto hará subir o bajar la pérdida. Con cientos de miles de millones de pesos en un modelo moderno, calcular todos esos gradientes a la vez requiere una maquinaria matemática considerable, pero la lógica de fondo es sencilla.

Cómo funciona el descenso por gradiente
Después de que la retropropagación calcule los gradientes, el descenso por gradiente los usa para actualizar los pesos. El concepto es directo: mover cada peso un poco en la dirección que reduce la pérdida.
El tamaño de cada paso lo controla la tasa de aprendizaje. Si es demasiado grande, el modelo se pasa de largo y rebota sin llegar a estabilizarse. Si es demasiado pequeña, el entrenamiento tarda una eternidad.
Una analogía útil: imagina la pérdida como un paisaje físico con montañas y valles. Los pesos actuales del modelo lo sitúan en un punto de ese terreno. El descenso por gradiente es el proceso de dar pasos pequeños, uno tras otro, cuesta abajo hacia el valle más bajo.

Este bucle (pase hacia delante, cálculo de la pérdida, retropropagación de gradientes y actualización de pesos) se repite miles de millones de veces a lo largo de un entrenamiento. Cada pasada por un lote de datos se llama paso; una pasada completa por todo el conjunto de datos es una época.
| Término | Qué significa |
|---|
| Función de pérdida | Mide el error entre la predicción y la realidad |
| Retropropagación | Calcula qué pesos causaron el error |
| Descenso por gradiente | Actualiza los pesos para reducir el error |
| Tasa de aprendizaje | Controla lo grande que es cada actualización de los pesos |
| Época | Una pasada completa por el conjunto de datos de entrenamiento |
Qué hace que un modelo sea "de código abierto"
Pesos abiertos frente a código abierto completo
Esta distinción importa más de lo que la mayoría se da cuenta. Un modelo con pesos abiertos pone sus parámetros entrenados a disposición de cualquiera para descargarlos. Puedes ejecutarlo en tu equipo, ajustarlo y construir aplicaciones sobre él. Modelos como SDXL y Stable Diffusion 3.5 Large entran en esta categoría.
Un modelo de código abierto completo también publica el código de entrenamiento, el conjunto de datos y la documentación que cubre todo el proceso. Son muchos menos los modelos que superan este listón más alto.
Conviene saberlo: "Código abierto" en IA no siempre significa lo mismo que en software. Muchos modelos populares de IA que la gente llama de código abierto solo comparten los pesos, no la receta completa que se usó para crearlos.
Por qué importa a los creadores
Los pesos abiertos son muy importantes para quienes trabajan con estos modelos. Permiten ejecutar la inferencia sin pagar costos de API, operar el modelo en tu propio equipo y modificar los pesos para casos de uso concretos. También permiten que la comunidad audite el modelo en busca de sesgos, cree herramientas de seguridad y publique versiones mejoradas.
Modelos como Flux 1.1 Pro Ultra e Imagen 4 representan filosofías distintas dentro de este espectro: algunos dan prioridad a la accesibilidad mediante pesos abiertos, mientras que otros siguen siendo propietarios por motivos de calidad o seguridad.

El ajuste fino después del preentrenamiento
LoRA y adaptadores
El preentrenamiento produce un modelo de propósito general, pero rara vez es el paso final. El ajuste fino adapta un modelo preentrenado para que funcione mejor en un dominio o estilo concreto. El problema es que hacer un ajuste fino completo de un modelo de mil millones de parámetros es caro y lento.
LoRA (Low-Rank Adaptation) resuelve esto congelando los pesos originales del modelo e insertando pequeñas matrices entrenables en capas específicas. En lugar de reentrenarlo todo, solo entrenas los pesos del adaptador LoRA, que son una fracción minúscula del número total de parámetros. El resultado es un modelo que se comporta de forma distinta en aspectos concretos y conserva todo su conocimiento base.
Así funciona exactamente Flux Dev LoRA en PicassoIA. El modelo base Flux Dev permanece fijo, mientras que un pequeño conjunto de pesos aprendidos orienta la salida hacia estilos visuales, personajes o sujetos concretos. Cualquiera con un hardware modesto puede entrenar un LoRA con unos cientos de imágenes y obtener un modelo que genera de forma fiable una estética específica.

RLHF y alineación
En los modelos de lenguaje, y cada vez más en los generadores de imágenes, el aprendizaje por refuerzo a partir de retroalimentación humana (RLHF, por sus siglas en inglés) se usa después del preentrenamiento para que los resultados se ajusten mejor a lo que la gente quiere de verdad. El proceso consiste en que evaluadores humanos puntúan las salidas del modelo, se entrena un modelo de recompensa aparte con esas puntuaciones y, después, se usa aprendizaje por refuerzo para empujar el modelo principal hacia comportamientos mejor valorados.
El RLHF es lo que distingue a un modelo preentrenado en bruto, capaz de producir cualquier cosa, de uno que genera resultados útiles, seguros y de alta calidad de forma fiable. Es costoso desde el punto de vista computacional y requiere un diseño cuidadoso, pero su efecto sobre la calidad percibida de los resultados es considerable.

El hardware necesario
Clústeres de GPU a gran escala
Entrenar un modelo grande de IA requiere un clúster coordinado de cientos o miles de GPU funcionando en paralelo durante semanas o meses. Los entrenamientos modernos de modelos de frontera usan clústeres de NVIDIA H100 conectados mediante NVLink de alto ancho de banda y redes InfiniBand, para repartir el cálculo entre miles de chips simultáneamente.
La razón por la que el paralelismo es necesario es directa: un solo pase hacia delante y hacia atrás por un modelo grande produce más operaciones de punto flotante de las que cualquier GPU individual puede completar en un plazo razonable. Repartir el trabajo entre muchas GPU, cada una procesando una porción de los datos o un segmento del modelo, es la única opción práctica a gran escala.

Por qué entrenar cuesta millones
Una sola GPU NVIDIA H100 cuesta más de 25.000 $, y un entrenamiento competitivo puede usar miles de ellas durante meses. A los costos del hardware se suman la electricidad (los entrenamientos grandes consumen megavatios), la infraestructura de refrigeración, las tarifas de computación en la nube y el trabajo de los equipos de investigación.
Por eso solo un puñado de organizaciones puede entrenar desde cero modelos fundacionales realmente grandes. La comunidad de código abierto suele construir sobre estos modelos fundacionales mediante ajuste fino y adaptación, lo que cuesta órdenes de magnitud menos y aun así produce resultados notables.
| Enfoque de entrenamiento | Costo aproximado | Quién lo hace |
|---|
| Preentrenamiento desde cero | 1 M$ a más de 100 M$ | Grandes laboratorios de investigación y startups con mucha financiación |
| Ajuste fino completo | 10 mil $ a 500 mil $ | Equipos de investigación de tamaño medio |
| Ajuste fino con LoRA | 50 $ a 5.000 $ | Investigadores individuales y equipos pequeños |
| Ejecutar inferencia | Céntimos por solicitud | Cualquiera |
Modelos de código abierto que impulsan el arte con IA hoy
Flux, Stable Diffusion y más
Los modelos que impulsan la generación de imágenes con IA actual descienden casi todos de la tradición de código abierto. Stable Diffusion demostró en 2022 que un modelo de generación de imágenes de alta calidad podía entrenarse y publicarse abiertamente, lo que desencadenó una explosión de innovación comunitaria. Miles de ajustes finos, LoRA y modelos derivados llegaron en cuestión de meses.
Flux Dev y Flux Pro, de Black Forest Labs, representan el siguiente paso: una arquitectura basada en transformers, entrenada a mayor escala, con una comprensión del texto y un fotorrealismo notablemente mejorados. El enfoque de entrenamiento se basa en los mismos principios descritos a lo largo de este artículo, aplicados con más datos, más cómputo y refinamientos de arquitectura que mejoraron la coherencia y la fidelidad al prompt.
SDXL amplió el Stable Diffusion original al escalar tanto el modelo como el conjunto de datos de entrenamiento, y produjo resultados de mayor resolución y más detallados. Stable Diffusion 3.5 Large fue todavía más lejos al adoptar una arquitectura de transformer de difusión multimodal, que genera composiciones más nítidas y una mejor alineación semántica.
Cada uno de estos modelos pasó por el mismo proceso fundamental: curación del conjunto de datos, preentrenamiento con minimización de la pérdida mediante descenso por gradiente y, después, ajuste fino para alinear los resultados con las preferencias humanas.
Pruébalos hoy mismo en PicassoIA

Todos los modelos que se comentan aquí están disponibles para ejecutarse directamente en PicassoIA. Sin configuración local, sin requisitos de hardware y sin tener que gestionar archivos de pesos ni entornos de Python. Puedes experimentar con:
- Flux Dev: El producto estrella de pesos abiertos de Black Forest Labs, ideal para la generación fotorrealista detallada.
- Flux Schnell: La versión destilada y más rápida, pensada para iterar y crear prototipos con agilidad.
- Flux Dev LoRA: Flux Dev con adaptadores LoRA personalizados para generar contenido con un estilo concreto.
- SDXL: Sigue siendo uno de los modelos de imagen de código abierto más versátiles disponibles.
- Stable Diffusion 3.5 Large: La arquitectura más reciente de Stability AI, con mejoras de transformer multimodal.
- Flux 1.1 Pro: Resultados de calidad comercial de la familia Flux, con un fotorrealismo refinado.
- Imagen 4: El modelo de texto a imagen más reciente de Google, con un detalle y una reproducción del color excepcionales.
Usar modelos entrenados ahora mismo
La distancia entre "cómo funciona el entrenamiento" y "lo que realmente puedes crear" es menor de lo que parece. Cuando escribes un prompt en una interfaz de texto a imagen, los pesos que se consultan son el producto directo de todo lo descrito antes: meses de curación de datos, miles de millones de actualizaciones de gradiente y un trabajo cuidadoso de alineación. La calidad que ves en el resultado refleja decisiones tomadas en cada etapa de ese pipeline.
Para la mayoría de los creadores, lo relevante no es cómo entrenar un modelo desde cero, sino cómo trabajar con las capas de adaptación que se apoyan en los pesos preentrenados. Los ajustes finos con LoRA te permiten orientar un modelo base potente hacia un rostro, un estilo artístico o un concepto visual concreto usando unos cientos de imágenes de entrenamiento y hardware modesto. Esa es la parte del entrenamiento de IA de código abierto que hoy está realmente al alcance de las personas, ahora mismo y sin un presupuesto de investigación.
Vale la pena probarlo: Si quieres ver cómo afectan los distintos enfoques de entrenamiento a la calidad de los resultados, pasa el mismo prompt por Flux Schnell, Flux Dev y SDXL lado a lado en PicassoIA. Las diferencias en fotorrealismo, fidelidad al prompt y composición reflejan directamente las decisiones de entrenamiento tomadas para cada modelo.
Cada vez que generas una imagen, eres el último eslabón de un pipeline que empezó con petabytes de datos, miles de millones de actualizaciones de parámetros y el esfuerzo colectivo de investigadores que decidieron compartir su trabajo de forma abierta. Los modelos de PicassoIA son el resultado de ese trabajo, listos para usarse sin tocar una sola línea de código de entrenamiento.
Empieza con Flux Dev o Stable Diffusion 3.5 Large y mira lo que pueden producir millones de iteraciones de entrenamiento a partir de una sola frase.