Mejor agente de IA para generar imágenes (gratis y en local): qué funciona de verdad en tu propio PC

Un agente de imágenes gratuito y en local combina un modelo de lenguaje pequeño con un backend de difusión en tu propia tarjeta gráfica. Este artículo compara las configuraciones de ComfyUI, InvokeAI, Forge, Fooocus y Open WebUI, detalla la VRAM real que necesitan y muestra cuándo conviene una opción alojada si tu equipo se queda corto.

Mejor agente de IA para generar imágenes (gratis y en local): qué funciona de verdad en tu propio PC
Cristian Da Conceicao
Fundador de Picasso IA

La mayoría de quienes buscan un agente de IA gratuito para imágenes quieren lo mismo: escribir una petición, obtener una imagen terminada y no ver nunca una factura. El problema es que la palabra "agente" esconde dos trabajos distintos. Una parte piensa: lee tu petición, escribe un prompt más preciso, revisa el resultado e inténtalo de nuevo. La otra parte pinta: un modelo de difusión que convierte ese prompt en píxeles. Puedes ejecutar las dos cosas en un PC doméstico sin gastar un dólar al mes, pero solo si las piezas encajan con tu tarjeta gráfica.

Este artículo compara las configuraciones que la gente de verdad usa en casa, muestra qué hardware necesita cada una y señala una opción ganadora clara para la mayoría de lectores. También indica dónde una configuración local se queda sin recorrido, porque fingir que nunca ocurre te haría perder el fin de semana.

Qué es realmente un agente de imágenes

Un joven escribiendo en un equipo portátil en una mesa de cocina con luz de la mañana

El cerebro y el pincel

Un generador de imágenes normal toma un prompt y devuelve una imagen. Un agente envuelve ese proceso en un bucle. Un modelo de lenguaje lee tu objetivo ("una foto de producto de una taza de cerámica sobre un paño de lino, luz de la mañana"), lo amplía hasta convertirlo en un prompt detallado, llama a la herramienta de imagen, mira el resultado y decide si lo conserva o lo intenta de nuevo.

En una versión local, el cerebro suele ser un modelo de lenguaje pequeño de pesos abiertos servido por Ollama o LM Studio. Entre los candidatos de tamaño local están IBM Granite 4.1 8B y GPT OSS 20B. El pincel es un modelo de difusión que funciona dentro de ComfyUI, InvokeAI, Forge o una interfaz similar.

Por qué importa que sea gratis y en local

Ejecutarlo en local elimina tres molestias recurrentes:

  • Sin tarifas por imagen. Tu costo es la electricidad y la tarjeta que ya tienes.
  • Sin cola. El tráfico de otros no ralentiza tu lote.
  • Privacidad total. Las fotos de referencia, los archivos de clientes y los productos no lanzados nunca salen de tu equipo.

💡 Prueba rápida: Si generas menos de unas pocas docenas de imágenes al mes, una configuración local puede costarte más tiempo de instalación del que te ahorra. Si generas cientos, se amortiza muy rápido.

El hardware que necesitas primero

Manos instalando una tarjeta gráfica grande de tres ventiladores en la carcasa de un equipo de escritorio

La VRAM decide casi todo

La memoria de video de tu tarjeta gráfica es el primer filtro. La velocidad del procesador y la RAM del sistema importan mucho menos. La tabla siguiente muestra niveles aproximados y prácticos. Las cifras exactas cambian según la versión del modelo, el nivel de cuantización y la resolución que pidas.

Memoria de videoModelos de imagen que funcionan bienModelo de lenguaje que cabe junto a élQué esperar
4 GBModelos antiguos y pequeños3B en 4 bitsLento, baja resolución
6 a 8 GBSDXL con descarga de memoria, modelos turbo compactos7B a 8B en 4 bitsImágenes de 1024 px utilizables en menos de un minuto
12 GBSDXL con holgura, variantes cuantizadas de FLUX8B en 4 bitsTrabajo diario fluido
16 a 24 GBFLUX 2 Dev y Qwen Image 2512 en precisión reducidaClase 20BLa mejor calidad local disponible

El modelo de imagen y el de lenguaje compiten por la misma memoria. La solución práctica es sencilla: haz que ComfyUI descargue los modelos entre pasos y pon el valor keep_alive de Ollama en un número bajo para que el modelo de lenguaje salga de la memoria una vez escrito el prompt. Ollama mantiene un modelo cargado cinco minutos por defecto, algo demasiado largo en una tarjeta de 8 GB.

Solo CPU y Apple Silicon

¿No tienes tarjeta gráfica dedicada? Aún tienes opciones, aunque más lentas. Los Mac con Apple Silicon comparten memoria entre el procesador y la GPU, así que un equipo de 32 GB puede cargar modelos sorprendentemente grandes. Apps gratuitas como Draw Things están diseñadas en torno a ese principio. Un PC solo con CPU puede ejecutar modelos diminutos, pero espera minutos por imagen en lugar de segundos.

Un pequeño despacho en un apartamento al atardecer, con una torre de escritorio junto a una mesa de madera

Los mejores conjuntos de herramientas locales, ordenados

Aquí tienes el ranking honesto, de más capaz a más amigable para principiantes. Todas las herramientas de la lista se descargan gratis.

StackIdeal paraListo para agentesEsfuerzo de instalación
ComfyUI más Ollama o LM StudioUsuarios avanzados, pipelines repetiblesSí, servidor API integradoAlto
Open WebUI más OllamaInterfaz de agente tipo chatSí, se conecta a ComfyUIMedio
InvokeAIEdición en lienzo, interfaz pulidaParcialmente, tiene APIBajo a medio
ForgeDiseño de WebUI familiar, menos uso de memoriaSí, con el flag de APIMedio
FooocusUsuarios que empiezan por primera vezLimitadoBajo

ComfyUI más un modelo de lenguaje local

Esta es la mejor opción en general. ComfyUI es una herramienta basada en nodos en la que cada paso de una generación es un bloque visible. Puede parecer intimidante, pero es lo que la hace compatible con agentes. Cualquier flujo de trabajo se puede exportar en formato API y activar mediante una llamada HTTP al puerto local (8188 por defecto). Tu modelo de lenguaje escribe el prompt, lo introduce en el JSON del flujo, lo envía y recoge el archivo terminado.

Por qué gana:

  • Admite la gama más amplia de modelos de imagen, incluidas las familias SDXL, FLUX y Qwen Image.
  • Los flujos de trabajo se guardan como archivos, así que un buen resultado es repetible.
  • Existen servidores MCP para ComfyUI creados por la comunidad, que permiten a los modelos con llamadas a herramientas manejarlo directamente. Revisa la actividad reciente de cada proyecto antes de confiar en uno.

💡 Consejo: Construye y prueba primero un flujo de trabajo a mano. Un agente solo puede repetir un pipeline que ya funciona.

Vista por encima del hombro de un desarrollador mirando un monitor lleno de fotografías terminadas

Open WebUI con Ollama

Si quieres hablar con tu agente en lugar de conectar JSON, Open WebUI es la vía más amigable. Te ofrece una interfaz de chat para modelos locales y puede enviar peticiones de imagen a ComfyUI o a un backend compatible con AUTOMATIC1111. Escribes "haz tres variaciones de una calle lluviosa al atardecer" y la ventana de chat se encarga del resto. Es menos flexible que programar directamente en ComfyUI, pero puedes ser productivo en una tarde.

InvokeAI para edición práctica

InvokeAI es de código abierto y está construido en torno a un lienzo. Pintas, enmascaras y regeneras regiones en el mismo sitio, algo que encaja con ilustradores y fotógrafos que editan más de lo que escriben prompts. No es una herramienta de agente pura, pero su API y su interfaz limpia lo convierten en una segunda instalación sólida junto a ComfyUI.

Forge y Fooocus para arranques rápidos

Forge es una bifurcación más ligera de la interfaz clásica de AUTOMATIC1111. Usa la memoria con más cuidado, así que las tarjetas antiguas le sacan más partido. Fooocus oculta casi todos los ajustes detrás de un único cuadro de prompt, lo que lo convierte en el punto de entrada más suave. Está en un modo de mantenimiento limitado, así que úsalo como herramienta de inicio y no como hogar a largo plazo.

Qué modelos de imagen ejecutar

Las manos de un fotógrafo sosteniendo una foto impresa de un paisaje junto a un equipo portátil que muestra una imagen parecida

El agente es tan bueno como su pincel. Así se comparan los modelos habituales, y cada uno tiene una página en PicassoIA donde puedes probarlo antes de dedicar una hora a descargar los pesos.

ModeloFortalezaMemoria típica necesaria
SDXLEnorme comunidad, muchos ajustes finos8 GB
Stable Diffusion 3.5 MediumBuen seguimiento del prompt, tarjetas de gama media10 a 12 GB
FLUX 2 Klein 4BPequeño y rápido8 a 12 GB
Z-Image TurboGeneración en pocos pasosModerada
FLUX 2 DevRealismo de primer nivel16 GB o más
Qwen Image 2512Renderizado de texto sólido16 GB o más

Opciones pequeñas y rápidas

Si tu tarjeta tiene 8 GB o menos, empieza con SDXL o Z-Image Turbo. Los modelos de estilo turbo solo necesitan un puñado de pasos, lo cual importa mucho cuando un agente puede pedir cuatro o cinco intentos por petición. Un modelo que tarda tres segundos por intento le gana a uno más bonito que tarda noventa.

Opciones de calidad para tarjetas más grandes

Con 16 GB o más, FLUX 2 Dev y Qwen Image 2512 ofrecen la piel, la tela y la iluminación más convincentes que puedes ejecutar en casa. Las versiones cuantizadas sacrifican algo de detalle a cambio de un uso de memoria mucho menor, y esa renuncia suele compensar.

Lee primero la ficha de licencia. "Gratis para descargar" y "gratis para cualquier uso" son cosas distintas. SDXL se distribuye bajo una licencia abierta permisiva. Stable Diffusion 3.5 es gratis para empresas pequeñas según los términos comunitarios de Stability. Los pesos abiertos de los modelos FLUX más grandes suelen tener condiciones no comerciales. Revisa la ficha del modelo antes de vender cualquier cosa creada con ellos.

Elige el modelo según tu tarjeta

Esta es la versión corta, por situación:

  • Tarjeta de 8 GB, primera vez: Fooocus o Forge con SDXL, y después añade Open WebUI cuando te sientas cómodo.
  • Tarjeta de 12 GB, quieres automatizar: ComfyUI con un modelo pequeño con llamadas a herramientas, como IBM Granite 4.1 8B.
  • Tarjeta de 16 a 24 GB, quieres la mejor calidad: ComfyUI con FLUX 2 Dev o Qwen Image 2512, y un modelo de lenguaje de clase 20B.
  • Usuario de Mac: Draw Things para trabajos rápidos, ComfyUI si quieres un pipeline de agente.
  • Sin hardware capaz: Omite la instalación y ejecuta los mismos modelos en PicassoIA.

Cómo funciona el bucle del agente

Una mesa ordenada con un cuaderno de bocetos, un ratón, una taza de café y fotografías impresas de paisajes

Prompt, generar, juzgar, reintentar

Todo agente de imágenes que funcione repite cuatro pasos:

  1. Prompt. El modelo de lenguaje reescribe tu petición corta en una detallada: sujeto, escenario, luz, objetivo, ambiente.
  2. Generar. Llama a la herramienta de imagen con ese prompt y un tamaño fijo.
  3. Juzgar. Un modelo con capacidad de visión, o un conjunto simple de reglas, revisa el resultado en busca de fallos evidentes, como manos deformadas o colores equivocados.
  4. Reintentar. Si la revisión falla, ajusta el prompt o la semilla y vuelve a ejecutar, hasta un límite que tú fijas.

Pon ese límite. Sin un tope de tres o cuatro intentos, una petición terca puede tener tu GPU ocupada toda la noche.

Conectar herramientas mediante MCP

El Model Context Protocol da al modelo de lenguaje una forma estándar de llamar a herramientas externas. LM Studio puede actuar como host MCP, y los modelos de Ollama con llamadas a herramientas pueden manejar configuraciones similares mediante pequeños scripts puente. En la práctica registras una herramienta ("generate_image") que reenvía el prompt a ComfyUI y devuelve la ruta de un archivo. Mantén la herramienta acotada. Una que solo acepta un prompt, una relación de aspecto y una semilla es más fácil de llamar correctamente para un modelo pequeño que una con veinte opciones.

💡 Regla de fiabilidad: Los modelos de lenguaje pequeños fallan con esquemas de herramientas largos. Menos parámetros significan menos llamadas rotas.

Dónde se queda corto lo local

Una mujer trabajando en un equipo portátil junto a la ventana de una cafetería con lluvia

El costo real de lo gratis

Lo local es gratis en dinero y caro en atención. Espera una tarde de instalaciones, algún que otro momento de fallos con los controladores y un mantenimiento constante a medida que las herramientas se actualizan. La electricidad es un costo menor de lo que la gente teme. Una tarjeta de 300 W funcionando una hora a 15 centavos por kilovatio-hora cuesta unos 4,5 centavos. El calor y el ruido del ventilador son la molestia diaria más grande, sobre todo en una habitación pequeña.

Los equipos portátiles tienen sus propios límites. Un equipo portátil con un chip gráfico modesto puede ejecutar SDXL, pero se ralentiza cuando se calienta y agota la batería rápido. Si trabajas desde cafés o trenes, una configuración local en tu escritorio de casa resulta difícil de usar, y los modelos ligeros en un equipo portátil no igualarán lo que produce una tarjeta de escritorio.

La alternativa alojada

Cuando el trabajo es más grande que tu tarjeta, o estás lejos de tu escritorio, una opción alojada cubre el hueco. PicassoIA tiene un amplio catálogo de texto a imagen, así que puedes probar FLUX 2 Dev, Qwen Image 2512, P-Image y Seedream 4.5 sin descargar nada. También aloja un modelo de cualquier flujo de trabajo de ComfyUI, lo cual es útil si ya construiste un pipeline y quieres ejecutarlo en hardware más potente. Muchos lectores acaban con un enfoque híbrido: local para borradores y trabajo privado, alojado para los renders finales pesados.

Cómo usar Flux 2 Dev en PicassoIA

Dos diseñadores revisando fotografías de producto impresas en una mesa de estudio

Es el mismo bucle que un agente local, hecho a mano, y una forma rápida de ver lo que un modelo puede hacer antes de dedicarle espacio en disco.

  1. Abre la página del modelo. Ve a FLUX 2 Dev en la colección de texto a imagen.
  2. Escribe el prompt por capas. Nombra primero el sujeto, luego el escenario, la luz y el objetivo. Por ejemplo: "una taza de cerámica sobre un paño de lino, luz suave de ventana desde la izquierda, objetivo de 50 mm, profundidad de campo reducida, grano de película".
  3. Elige la relación de aspecto según el destino. Usa 16:9 para banners de blog, 1:1 para fotos de producto y 9:16 para historias.
  4. Mantén la semilla. Cuando la composición es correcta pero un detalle falla, conserva la misma semilla y cambia una sola frase del prompt. Cambiar cinco cosas a la vez hace imposible ver qué funcionó.
  5. Genera dos o tres variaciones y compáralas. Quédate con la mejor y corrige pequeños defectos con un modelo de edición como Qwen Image Edit 2511.
  6. Deja que un modelo de lenguaje escriba tu siguiente prompt. Pega la descripción de tu resultado en Kimi K2.6 y pide tres variaciones de prompt más precisas. Esa es la mitad "cerebro" del agente, trabajando para ti.

💡 Consejo: Guarda un archivo de texto con los prompts que funcionaron. Más adelante se convertirá en la biblioteca inicial de tu agente local.

Pruébalo tú mismo en PicassoIA

No necesitas resolver la cuestión de lo local frente a lo alojado antes de empezar. Abre PicassoIA, elige un modelo de texto a imagen y ejecuta el mismo prompt en dos o tres de ellos. En diez minutos verás qué estilo encaja con tu trabajo, qué modelo merece una descarga y cuánto detalle necesitan tus prompts. Después construye tu agente local en torno al modelo que ya sabes que te gusta, y mantén PicassoIA abierto para los días en que tu propia tarjeta necesite descansar.

Escribe un prompt, pulsa generar y mira cómo se ve tu idea.

Compartir este artículo

Elige tu idioma