API de edición de imágenes: opciones gratuitas, OpenAI, Gemini y Qwen comparadas
Elegir una API de edición de imágenes depende del costo por edición, la velocidad, el soporte de máscaras y el control que necesitas. Este artículo pone una ruta gratuita, OpenAI, Gemini y Qwen una al lado de otra, con formatos de solicitud, señales de precio y una tabla de decisión breve para cada caso de uso.
La mayoría de las búsquedas de una API de edición de imágenes acaban igual: tres pestañas abiertas, una de OpenAI, otra de Gemini y otra de un repositorio de Qwen, y ninguna idea clara de cuál merece un fin de semana de trabajo de integración. Las tres se comportan de forma muy distinta cuando envías una foto real. Una quiere una máscara, otra quiere una conversación y otra necesita una GPU. Y algunas rutas más baratas quedan fuera de las tres.
Este artículo compara las opciones que importan en la práctica: una ruta gratuita, el endpoint de ediciones de OpenAI, el modelo de imagen de Gemini y la familia de edición Qwen. Verás la forma de la solicitud de cada una, las señales de precio en las que vale la pena confiar, los fallos que vas a encontrar y una tabla que asigna cada opción a una tarea. Cada modelo mencionado aquí también funciona en PicassoIA, así que puedes probar el mismo prompt en todos antes de escribir una sola línea de código de integración.
💡 Respuesta rápida: Para prototipos rápidos y pruebas ilimitadas, empieza con un editor alojado gratuito. Para un seguimiento estricto de instrucciones y control con máscaras, elige OpenAI. Para ediciones conversacionales de varios turnos, elige Gemini. Para pesos abiertos y ediciones con mucho texto, elige Qwen.
Qué hace una API de edición de imágenes
Una API de edición de imágenes toma una imagen existente más una instrucción y devuelve una imagen modificada. Suena a generación de imágenes, pero la diferencia lo decide todo. Una llamada de generación inventa píxeles desde cero. Una llamada de edición tiene que conservar casi todo el original, los rostros, la iluminación, la etiqueta del producto, y cambiar solo lo que pediste.
Llamadas de edición frente a llamadas de generación
Los dos tipos de llamada se parecen en la red, pero fallan de maneras distintas.
Entrada: una llamada de generación recibe texto. Una llamada de edición recibe una o más imágenes más texto, y a veces una máscara.
Salida: una llamada de generación no tiene nada con que compararse. Una llamada de edición se juzga frente al original, así que un rostro ligeramente desplazado o un logotipo cambiado cuenta como error.
Modo de fallo: la generación falla viéndose extraña. La edición falla desviándose, es decir, las partes que nunca mencionaste cambian en silencio.
Costo: las llamadas de edición suelen cobrar los tokens de la imagen de entrada además de la imagen de salida, así que la misma imagen puede costar más editarla que crearla.
Máscaras, referencias e instrucciones
Cada proveedor elige uno de tres estilos de control, y ese estilo define toda tu integración.
Basado en máscara: subes una segunda imagen donde se marca la zona a cambiar. Obtienes control quirúrgico, pero tienes que crear o generar la máscara tú mismo.
Solo instrucción: describes el cambio en lenguaje natural y el modelo decide dónde aplicarlo. La integración es trivial, pero la precisión depende de la redacción.
Basado en referencias: envías dos o tres imágenes y las mencionas por número, como en "pon la chaqueta de la imagen 2 en la persona de la imagen 1".
El inpainting, es decir, repintar una región seleccionada, es el uso clásico de una máscara. El outpainting, que amplía el lienzo más allá de los bordes originales, suele funcionar con la misma idea de máscara pero al revés.
Opciones gratuitas que de verdad funcionan
"Gratis" es la palabra más manoseada de este nicho, así que conviene separar tres significados: gratis para descargar, gratis para una prueba limitada y gratis para llamar a gran volumen.
Pesos abiertos que alojas tú
La descarga gratuita más sólida es la familia de edición Qwen, descrita en su propia sección más abajo. El modelo base Qwen Image es una versión de unos 20 000 millones de parámetros bajo la licencia Apache 2.0, que permite el uso comercial. La trampa está en el hardware: necesitas una GPU seria con mucha VRAM, o una versión cuantizada y paciencia. Tu costo pasa de cobros por imagen a servidores y tiempo de ingeniería.
FLUX Kontext Dev es otro editor de pesos abiertos. Lee su licencia antes de publicar nada, porque algunas versiones para desarrolladores restringen el uso comercial.
Niveles gratuitos y demos alojadas
Los grandes proveedores ofrecen niveles gratuitos para sus API de desarrollador, pero los límites, los modelos admitidos y los topes de frecuencia cambian a menudo, y la salida de imágenes suele estar más restringida que la de texto. Trata cualquier nivel gratuito como un lugar para prototipar y consulta la página de precios vigente antes de planificar un lanzamiento con él. Las páginas de demo públicas en sitios de alojamiento comunitarios sirven para juzgar la calidad y nada más. Se encolan, se duermen y desaparecen.
Dónde encaja PicassoIA
PicassoIA Image Editor Pro es el editor nativo de la plataforma, y su página de producto lo describe como ilimitado: sin tope por edición y sin cuota diaria. Acepta hasta tres imágenes de referencia y recibe un prompt en lenguaje natural.
Para desarrolladores, PicassoIA expone una API REST en https://api.picassoia.com/v1 con endpoints al estilo de Replicate: creas una predicción, consultas su estado y luego obtienes el resultado. Los límites a tener en cuenta son 5 predicciones simultáneas por cuenta, un cuerpo de solicitud de 10 MB y prompts de hasta 4000 caracteres. La documentación describe las predicciones de API como actualmente gratuitas, pero también menciona un requisito de plan, así que confirma las condiciones exactas en la página de precios antes de construir un negocio sobre ello.
API de edición de imágenes de OpenAI
La familia GPT Image de OpenAI es la referencia en seguimiento de instrucciones. Lee bien prompts largos y específicos, renderiza texto legible dentro de las imágenes y sigue de cerca las instrucciones de composición. En PicassoIA puedes probar GPT Image 2, GPT Image 1.5 y GPT Image 1 lado a lado.
Forma de la solicitud
El endpoint de ediciones recibe un formulario multipart: una o más imágenes, una máscara opcional y un prompt. Donde la máscara es transparente, el modelo puede cambiar píxeles.
curl https://api.openai.com/v1/images/edits \
-H "Authorization: Bearer $OPENAI_TOKEN" \
-F "model=gpt-image-1" \
-F "image=@room.png" \
-F "mask=@mask.png" \
-F "prompt=Replace the sofa with a green velvet sofa, keep the lighting"
Cambia el nombre del modelo por el modelo GPT Image más reciente que aparezca en tu cuenta. La calidad y el tamaño son parámetros separados, y son los que más influyen en la factura.
💡 Consejo: Indica qué debe quedar sin cambios, no solo qué debe cambiar. "Mantén idénticos el rostro, la camiseta y el fondo" reduce la desviación de forma notable.
Señales de precio
OpenAI cobra por tokens, y el precio efectivo por imagen depende del nivel de tamaño y calidad que pidas. Una señal más clara viene de Replicate, donde GPT Image 2 se cobra por imagen de salida: unos $0.012 en calidad baja, $0.047 en media y $0.128 en alta. La calidad alta cuesta unas diez veces más que la baja, así que un pipeline que use alta por defecto te sorprenderá a fin de mes.
Gemini edita mediante la misma llamada generateContent que usas para texto. Envías un cuerpo JSON al endpoint del modelo gemini-2.5-flash-image, con tus credenciales en el encabezado de la solicitud, y la imagen viaja como datos base64 junto a tu instrucción. La respuesta devuelve una imagen con la misma estructura.
No hace falta máscara. También puedes mantener una conversación, pidiendo un segundo cambio sobre el primero, que es la forma más rápida de iterar un look. Varias imágenes de referencia en una misma solicitud lo hacen adecuado para combinar una persona, un producto y una escena.
Dónde flaquea
Gemini es generoso con la creatividad y menos estricto con la conservación. Los detalles finos fuera de la zona editada pueden desplazarse, y no conviene confiar en una restauración de píxeles exacta de la región sin tocar. Los filtros de seguridad pueden rechazar solicitudes que otros modelos aceptan, y las salidas llevan una marca de procedencia invisible. Para un pipeline en el que la parte sin tocar de la imagen debe seguir idéntica, combina Gemini con un paso de verificación o elige un modelo basado en máscara.
Modelos de edición de imágenes Qwen
El equipo Qwen de Alibaba publicó un modelo de edición que destaca en dos áreas: cambiar texto dentro de una imagen y aplicar cambios de apariencia locales y precisos. En PicassoIA puedes ejecutar Qwen Image Edit, Qwen Image Edit Plus y Qwen Image Edit 2511.
Ediciones de texto y composición
Si tu trabajo incluye carteles, envases, menús o capturas de pantalla, Qwen merece una prueba antes que nada. Puede cambiar las palabras de un letrero manteniendo el estilo de la tipografía y la superficie sobre la que está el texto. También maneja ediciones semánticas, como girar un objeto o cambiar una pose, y ediciones de apariencia, como quitar un elemento que sobra en una escena. La variante Plus es la que conviene probar cuando necesitas varias imágenes de entrada, y las revisiones más nuevas como 2511 son las que conviene probar primero en cuanto a coherencia.
Alojado o autoalojado
Tienes tres rutas. Usa una API alojada de Alibaba Cloud o de un mercado de modelos para la comodidad de pagar por llamada. Usa una plataforma como PicassoIA para evitar la configuración de cuentas. O ejecuta tú mismo los pesos abiertos con la biblioteca diffusers cuando el volumen sea lo bastante alto como para justificar una GPU.
Los modelos de visión y lenguaje ayudan en los márgenes. Qwen3.7-Plus y Gemini 3.5 Flash pueden leer imágenes, así que puedes pedirle a uno que redacte el prompt de edición a partir de un breve encargo, o que compare las imágenes de antes y después y señale cualquier cambio que no pediste.
Costo, velocidad y encaje
El precio por llamada es solo un factor. La latencia, la tasa de reintentos y la cantidad de limpieza posterior a cada edición determinan el costo real.
P Image Edit merece una nota solo por la velocidad: se describe como edición en alrededor de un segundo, algo que importa cuando un usuario espera al otro lado de un botón.
Lee la tabla como punto de partida, no como veredicto. Los reintentos inflan todas las cifras. Si un modelo necesita tres intentos para dar un resultado limpio y otro necesita uno, el precio anunciado más bajo pierde. Mide la tasa de ediciones aceptadas de cada modelo con tus propias fotos y luego divide el gasto entre las ediciones aceptadas. Esa cifra única, el costo por edición aceptada, es el número que hay que comparar.
Fotos de producto para e-commerce
Los catálogos premian la coherencia por encima del ingenio. Elige un modelo, una plantilla de prompt y una semilla fija donde la API ofrezca una, y luego ejecuta todo el lote de la misma forma. Los cambios de fondo, la limpieza de sombras y las variantes de color son ediciones por instrucción, así que Gemini y Qwen las manejan sin máscaras.
Tres errores aparecen una y otra vez en los pipelines por lotes:
Mezclar modelos a mitad de lote. Dos modelos renderizan el mismo prompt con dominantes de color distintas, y el catálogo queda desigual.
Saltarse la comprobación de la zona sin cambios. La desviación pasa desapercibida hasta que un cliente ve una etiqueta deformada.
Ignorar los límites de concurrencia. Lanzar cientos de llamadas a la vez provoca limitaciones, así que pon los trabajos en cola y respeta el tope del proveedor, como las 5 predicciones simultáneas de PicassoIA.
Reserva un paso de verificación. Ejecuta un modelo de visión sobre una muestra de salidas y marca cualquiera con un logotipo deformado o una etiqueta cambiada. Detectar una imagen mala de cada cincuenta sale más barato que devolver el importe de un pedido.
Interiores inmobiliarios
Quitar objetos de forma virtual, cambiar el color de las paredes y reemplazar el cielo son las peticiones habituales. Las máscaras compensan aquí, porque los suelos, las ventanas y la geometría de la habitación no deben moverse. El endpoint de ediciones de OpenAI, con una máscara solo sobre el objeto que se quita, ofrece el control más preciso.
💡 Consejo: Las normas de los anuncios sobre fotos editadas varían según la región y el portal. Indica la edición cuando las normas lo exijan, y nunca alteres la estructura, como el tamaño de una habitación.
Cómo usar Image Editor Pro
Existe un modelo en PicassoIA para exactamente esta tarea, así que aquí tienes el camino más corto desde la foto hasta el resultado.
Añade tus imágenes. Sube hasta tres imágenes de referencia. La primera es la imagen principal que se edita.
Escribe el prompt. Describe el cambio en lenguaje natural y menciona las subidas como "imagen 1", "imagen 2" e "imagen 3".
Configura las opciones. Deja la relación de aspecto en match_input_image para mantener las dimensiones originales, elige WebP, JPG o PNG, y fija una semilla si quieres reproducir el resultado.
Genera y compara. Pide dos salidas por llamada para ver variaciones, y guarda la que mantenga intactas las zonas sin tocar.
Parámetro
Qué hace
Valor por defecto
images
Hasta 3 imágenes de referencia, la primera es la principal
Obligatorio
prompt
La edición, con referencias como "imagen 1"
Obligatorio
num_outputs
1 o 2 resultados por llamada
1
aspect_ratio
Forma de salida, o igualar la entrada
match_input_image
output_format
WebP, JPG o PNG
webp
output_quality
De 0 a 100 para JPG y WebP
95
seed
Resultados reproducibles
Aleatorio
Para código, al mismo modelo se llega a través de la API de PicassoIA. La solicitud sigue las convenciones de Replicate, así que revisa los ejemplos oficiales para los nombres exactos de los campos antes de publicar.
curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image-editor-pro/predictions \
-H "Authorization: Bearer $PICASSOIA_TOKEN" \
-H "Content-Type: application/json" \
-d '{"input":{"images":["https://example.com/room.jpg"],"prompt":"Replace the sofa with a green velvet sofa, keep the lighting"}}'
💡 Consejo: Ejecuta el mismo prompt con Nano Banana 2, GPT Image 2 y Qwen Image Edit 2511 antes de elegir proveedor. Diez minutos de pruebas lado a lado valen más que una tarde leyendo páginas de precios.
Prueba tus propias ediciones hoy
Ya tienes el panorama práctico: OpenAI para un control estricto, Gemini para cambios conversacionales rápidos, Qwen para texto y pesos abiertos, y un editor alojado gratuito para pruebas de volumen. La forma más rápida de encontrar tu opción es pasar una foto real de tu proyecto por todas ellas.
Abre PicassoIA Image Editor Pro, sube una foto de producto, un retrato o una habitación, y escribe la edición por la que de otro modo pagarías a un retocador. Compárala también con Seedream 4.5 y FLUX Kontext Pro, y luego termina el mejor resultado con superresolución para una exportación nítida a 2x o 4x. Cuando estés listo para comparar más opciones, explora todos los modelos en picassoia.com/en/all-models y empieza a crear tus propias imágenes hoy.