La mayoría de quienes buscan un agente de IA gratuito para imágenes quieren lo mismo: escribir una petición, obtener una imagen terminada y no ver nunca una factura. El problema es que la palabra "agente" esconde dos trabajos distintos. Una parte piensa: lee tu petición, escribe un prompt más preciso, revisa el resultado e inténtalo de nuevo. La otra parte pinta: un modelo de difusión que convierte ese prompt en píxeles. Puedes ejecutar las dos cosas en un PC doméstico sin gastar un dólar al mes, pero solo si las piezas encajan con tu tarjeta gráfica.
Este artículo compara las configuraciones que la gente de verdad usa en casa, muestra qué hardware necesita cada una y señala una opción ganadora clara para la mayoría de lectores. También indica dónde una configuración local se queda sin recorrido, porque fingir que nunca ocurre te haría perder el fin de semana.
Qué es realmente un agente de imágenes

El cerebro y el pincel
Un generador de imágenes normal toma un prompt y devuelve una imagen. Un agente envuelve ese proceso en un bucle. Un modelo de lenguaje lee tu objetivo ("una foto de producto de una taza de cerámica sobre un paño de lino, luz de la mañana"), lo amplía hasta convertirlo en un prompt detallado, llama a la herramienta de imagen, mira el resultado y decide si lo conserva o lo intenta de nuevo.
En una versión local, el cerebro suele ser un modelo de lenguaje pequeño de pesos abiertos servido por Ollama o LM Studio. Entre los candidatos de tamaño local están IBM Granite 4.1 8B y GPT OSS 20B. El pincel es un modelo de difusión que funciona dentro de ComfyUI, InvokeAI, Forge o una interfaz similar.
Por qué importa que sea gratis y en local
Ejecutarlo en local elimina tres molestias recurrentes:
- Sin tarifas por imagen. Tu costo es la electricidad y la tarjeta que ya tienes.
- Sin cola. El tráfico de otros no ralentiza tu lote.
- Privacidad total. Las fotos de referencia, los archivos de clientes y los productos no lanzados nunca salen de tu equipo.
💡 Prueba rápida: Si generas menos de unas pocas docenas de imágenes al mes, una configuración local puede costarte más tiempo de instalación del que te ahorra. Si generas cientos, se amortiza muy rápido.
El hardware que necesitas primero

La VRAM decide casi todo
La memoria de video de tu tarjeta gráfica es el primer filtro. La velocidad del procesador y la RAM del sistema importan mucho menos. La tabla siguiente muestra niveles aproximados y prácticos. Las cifras exactas cambian según la versión del modelo, el nivel de cuantización y la resolución que pidas.
| Memoria de video | Modelos de imagen que funcionan bien | Modelo de lenguaje que cabe junto a él | Qué esperar |
|---|
| 4 GB | Modelos antiguos y pequeños | 3B en 4 bits | Lento, baja resolución |
| 6 a 8 GB | SDXL con descarga de memoria, modelos turbo compactos | 7B a 8B en 4 bits | Imágenes de 1024 px utilizables en menos de un minuto |
| 12 GB | SDXL con holgura, variantes cuantizadas de FLUX | 8B en 4 bits | Trabajo diario fluido |
| 16 a 24 GB | FLUX 2 Dev y Qwen Image 2512 en precisión reducida | Clase 20B | La mejor calidad local disponible |
El modelo de imagen y el de lenguaje compiten por la misma memoria. La solución práctica es sencilla: haz que ComfyUI descargue los modelos entre pasos y pon el valor keep_alive de Ollama en un número bajo para que el modelo de lenguaje salga de la memoria una vez escrito el prompt. Ollama mantiene un modelo cargado cinco minutos por defecto, algo demasiado largo en una tarjeta de 8 GB.
Solo CPU y Apple Silicon
¿No tienes tarjeta gráfica dedicada? Aún tienes opciones, aunque más lentas. Los Mac con Apple Silicon comparten memoria entre el procesador y la GPU, así que un equipo de 32 GB puede cargar modelos sorprendentemente grandes. Apps gratuitas como Draw Things están diseñadas en torno a ese principio. Un PC solo con CPU puede ejecutar modelos diminutos, pero espera minutos por imagen en lugar de segundos.

Los mejores conjuntos de herramientas locales, ordenados
Aquí tienes el ranking honesto, de más capaz a más amigable para principiantes. Todas las herramientas de la lista se descargan gratis.
| Stack | Ideal para | Listo para agentes | Esfuerzo de instalación |
|---|
| ComfyUI más Ollama o LM Studio | Usuarios avanzados, pipelines repetibles | Sí, servidor API integrado | Alto |
| Open WebUI más Ollama | Interfaz de agente tipo chat | Sí, se conecta a ComfyUI | Medio |
| InvokeAI | Edición en lienzo, interfaz pulida | Parcialmente, tiene API | Bajo a medio |
| Forge | Diseño de WebUI familiar, menos uso de memoria | Sí, con el flag de API | Medio |
| Fooocus | Usuarios que empiezan por primera vez | Limitado | Bajo |
ComfyUI más un modelo de lenguaje local
Esta es la mejor opción en general. ComfyUI es una herramienta basada en nodos en la que cada paso de una generación es un bloque visible. Puede parecer intimidante, pero es lo que la hace compatible con agentes. Cualquier flujo de trabajo se puede exportar en formato API y activar mediante una llamada HTTP al puerto local (8188 por defecto). Tu modelo de lenguaje escribe el prompt, lo introduce en el JSON del flujo, lo envía y recoge el archivo terminado.
Por qué gana:
- Admite la gama más amplia de modelos de imagen, incluidas las familias SDXL, FLUX y Qwen Image.
- Los flujos de trabajo se guardan como archivos, así que un buen resultado es repetible.
- Existen servidores MCP para ComfyUI creados por la comunidad, que permiten a los modelos con llamadas a herramientas manejarlo directamente. Revisa la actividad reciente de cada proyecto antes de confiar en uno.
💡 Consejo: Construye y prueba primero un flujo de trabajo a mano. Un agente solo puede repetir un pipeline que ya funciona.

Open WebUI con Ollama
Si quieres hablar con tu agente en lugar de conectar JSON, Open WebUI es la vía más amigable. Te ofrece una interfaz de chat para modelos locales y puede enviar peticiones de imagen a ComfyUI o a un backend compatible con AUTOMATIC1111. Escribes "haz tres variaciones de una calle lluviosa al atardecer" y la ventana de chat se encarga del resto. Es menos flexible que programar directamente en ComfyUI, pero puedes ser productivo en una tarde.
InvokeAI para edición práctica
InvokeAI es de código abierto y está construido en torno a un lienzo. Pintas, enmascaras y regeneras regiones en el mismo sitio, algo que encaja con ilustradores y fotógrafos que editan más de lo que escriben prompts. No es una herramienta de agente pura, pero su API y su interfaz limpia lo convierten en una segunda instalación sólida junto a ComfyUI.
Forge y Fooocus para arranques rápidos
Forge es una bifurcación más ligera de la interfaz clásica de AUTOMATIC1111. Usa la memoria con más cuidado, así que las tarjetas antiguas le sacan más partido. Fooocus oculta casi todos los ajustes detrás de un único cuadro de prompt, lo que lo convierte en el punto de entrada más suave. Está en un modo de mantenimiento limitado, así que úsalo como herramienta de inicio y no como hogar a largo plazo.
Qué modelos de imagen ejecutar

El agente es tan bueno como su pincel. Así se comparan los modelos habituales, y cada uno tiene una página en PicassoIA donde puedes probarlo antes de dedicar una hora a descargar los pesos.
Opciones pequeñas y rápidas
Si tu tarjeta tiene 8 GB o menos, empieza con SDXL o Z-Image Turbo. Los modelos de estilo turbo solo necesitan un puñado de pasos, lo cual importa mucho cuando un agente puede pedir cuatro o cinco intentos por petición. Un modelo que tarda tres segundos por intento le gana a uno más bonito que tarda noventa.
Opciones de calidad para tarjetas más grandes
Con 16 GB o más, FLUX 2 Dev y Qwen Image 2512 ofrecen la piel, la tela y la iluminación más convincentes que puedes ejecutar en casa. Las versiones cuantizadas sacrifican algo de detalle a cambio de un uso de memoria mucho menor, y esa renuncia suele compensar.
Lee primero la ficha de licencia. "Gratis para descargar" y "gratis para cualquier uso" son cosas distintas. SDXL se distribuye bajo una licencia abierta permisiva. Stable Diffusion 3.5 es gratis para empresas pequeñas según los términos comunitarios de Stability. Los pesos abiertos de los modelos FLUX más grandes suelen tener condiciones no comerciales. Revisa la ficha del modelo antes de vender cualquier cosa creada con ellos.
Elige el modelo según tu tarjeta
Esta es la versión corta, por situación:
- Tarjeta de 8 GB, primera vez: Fooocus o Forge con SDXL, y después añade Open WebUI cuando te sientas cómodo.
- Tarjeta de 12 GB, quieres automatizar: ComfyUI con un modelo pequeño con llamadas a herramientas, como IBM Granite 4.1 8B.
- Tarjeta de 16 a 24 GB, quieres la mejor calidad: ComfyUI con FLUX 2 Dev o Qwen Image 2512, y un modelo de lenguaje de clase 20B.
- Usuario de Mac: Draw Things para trabajos rápidos, ComfyUI si quieres un pipeline de agente.
- Sin hardware capaz: Omite la instalación y ejecuta los mismos modelos en PicassoIA.
Cómo funciona el bucle del agente

Prompt, generar, juzgar, reintentar
Todo agente de imágenes que funcione repite cuatro pasos:
- Prompt. El modelo de lenguaje reescribe tu petición corta en una detallada: sujeto, escenario, luz, objetivo, ambiente.
- Generar. Llama a la herramienta de imagen con ese prompt y un tamaño fijo.
- Juzgar. Un modelo con capacidad de visión, o un conjunto simple de reglas, revisa el resultado en busca de fallos evidentes, como manos deformadas o colores equivocados.
- Reintentar. Si la revisión falla, ajusta el prompt o la semilla y vuelve a ejecutar, hasta un límite que tú fijas.
Pon ese límite. Sin un tope de tres o cuatro intentos, una petición terca puede tener tu GPU ocupada toda la noche.
Conectar herramientas mediante MCP
El Model Context Protocol da al modelo de lenguaje una forma estándar de llamar a herramientas externas. LM Studio puede actuar como host MCP, y los modelos de Ollama con llamadas a herramientas pueden manejar configuraciones similares mediante pequeños scripts puente. En la práctica registras una herramienta ("generate_image") que reenvía el prompt a ComfyUI y devuelve la ruta de un archivo. Mantén la herramienta acotada. Una que solo acepta un prompt, una relación de aspecto y una semilla es más fácil de llamar correctamente para un modelo pequeño que una con veinte opciones.
💡 Regla de fiabilidad: Los modelos de lenguaje pequeños fallan con esquemas de herramientas largos. Menos parámetros significan menos llamadas rotas.
Dónde se queda corto lo local

El costo real de lo gratis
Lo local es gratis en dinero y caro en atención. Espera una tarde de instalaciones, algún que otro momento de fallos con los controladores y un mantenimiento constante a medida que las herramientas se actualizan. La electricidad es un costo menor de lo que la gente teme. Una tarjeta de 300 W funcionando una hora a 15 centavos por kilovatio-hora cuesta unos 4,5 centavos. El calor y el ruido del ventilador son la molestia diaria más grande, sobre todo en una habitación pequeña.
Los equipos portátiles tienen sus propios límites. Un equipo portátil con un chip gráfico modesto puede ejecutar SDXL, pero se ralentiza cuando se calienta y agota la batería rápido. Si trabajas desde cafés o trenes, una configuración local en tu escritorio de casa resulta difícil de usar, y los modelos ligeros en un equipo portátil no igualarán lo que produce una tarjeta de escritorio.
La alternativa alojada
Cuando el trabajo es más grande que tu tarjeta, o estás lejos de tu escritorio, una opción alojada cubre el hueco. PicassoIA tiene un amplio catálogo de texto a imagen, así que puedes probar FLUX 2 Dev, Qwen Image 2512, P-Image y Seedream 4.5 sin descargar nada. También aloja un modelo de cualquier flujo de trabajo de ComfyUI, lo cual es útil si ya construiste un pipeline y quieres ejecutarlo en hardware más potente. Muchos lectores acaban con un enfoque híbrido: local para borradores y trabajo privado, alojado para los renders finales pesados.
Cómo usar Flux 2 Dev en PicassoIA

Es el mismo bucle que un agente local, hecho a mano, y una forma rápida de ver lo que un modelo puede hacer antes de dedicarle espacio en disco.
- Abre la página del modelo. Ve a FLUX 2 Dev en la colección de texto a imagen.
- Escribe el prompt por capas. Nombra primero el sujeto, luego el escenario, la luz y el objetivo. Por ejemplo: "una taza de cerámica sobre un paño de lino, luz suave de ventana desde la izquierda, objetivo de 50 mm, profundidad de campo reducida, grano de película".
- Elige la relación de aspecto según el destino. Usa 16:9 para banners de blog, 1:1 para fotos de producto y 9:16 para historias.
- Mantén la semilla. Cuando la composición es correcta pero un detalle falla, conserva la misma semilla y cambia una sola frase del prompt. Cambiar cinco cosas a la vez hace imposible ver qué funcionó.
- Genera dos o tres variaciones y compáralas. Quédate con la mejor y corrige pequeños defectos con un modelo de edición como Qwen Image Edit 2511.
- Deja que un modelo de lenguaje escriba tu siguiente prompt. Pega la descripción de tu resultado en Kimi K2.6 y pide tres variaciones de prompt más precisas. Esa es la mitad "cerebro" del agente, trabajando para ti.
💡 Consejo: Guarda un archivo de texto con los prompts que funcionaron. Más adelante se convertirá en la biblioteca inicial de tu agente local.
Pruébalo tú mismo en PicassoIA
No necesitas resolver la cuestión de lo local frente a lo alojado antes de empezar. Abre PicassoIA, elige un modelo de texto a imagen y ejecuta el mismo prompt en dos o tres de ellos. En diez minutos verás qué estilo encaja con tu trabajo, qué modelo merece una descarga y cuánto detalle necesitan tus prompts. Después construye tu agente local en torno al modelo que ya sabes que te gusta, y mantén PicassoIA abierto para los días en que tu propia tarjeta necesite descansar.
Escribe un prompt, pulsa generar y mira cómo se ve tu idea.