Qwen Image 2 Pro: la edición precisa, a prueba

Qwen Image 2 Pro se pone a prueba en flujos de trabajo comerciales reales: cambio de fondo en fotos de producto, carteles con texto dentro de la imagen y transferencia de estilo a partir de una referencia. Este artículo muestra qué hace bien el modelo, dónde se queda corto y con qué herramientas combinarlo para obtener resultados listos para producción.

Qwen Image 2 Pro: la edición precisa, a prueba
Cristian Da Conceicao
Fundador de Picasso IA

Si llevas tiempo con generadores de imágenes de IA, conoces los fallos habituales: palabras que se convierten en ruido visual, imágenes de referencia que se ignoran a medias y prompts que salen un poco torcidos de formas que no logras identificar. Qwen Image 2 Pro afirma resolver esos problemas concretos. Esto es lo que ocurrió de verdad al probarlo con flujos de trabajo comerciales reales.

Qué hace realmente Qwen Image 2 Pro

La mayoría de los modelos de texto a imagen comparten la misma arquitectura básica: escribes un prompt y obtienes una imagen. La calidad de la generación varía, pero la interfaz es casi idéntica en todas las herramientas. Qwen Image 2 Pro funciona de otra manera en un aspecto importante: acepta a la vez un prompt de texto y una imagen de referencia opcional, de modo que puedes partir de cero o rediseñar una foto existente mediante una descripción.

Esa entrada de imagen de referencia cambia la forma de plantear los proyectos. En lugar de describirlo todo desde el principio cada vez, traes una foto real y describes lo que quieres cambiar. El modelo se encarga de la transición. Es un cambio importante para quien trabaja en fotografía de producto, trabajo editorial o presentaciones para clientes, donde el punto de partida es un recurso real y no un lienzo en blanco.

El modelo se basa en la combinación de un codificador visión-lenguaje y un decodificador de difusión. El codificador lee a la vez las entradas de texto y de imagen, por eso la integración de la imagen de referencia resulta más ajustada que simplemente alimentar una foto en un pipeline img2img estándar. Las señales de texto y visuales se procesan juntas desde el principio, no en secuencia.

Renderizado de texto que no se rompe

La función más comentada es el renderizado preciso de texto dentro de la imagen. Los generadores de IA han fallado tradicionalmente en esto, porque generar texto requiere razonamiento espacial que los modelos de difusión estándar manejan mal. Las letras se transponen, el espaciado se colapsa y las tipografías se vuelven decorativas cuando pediste un palo seco limpio.

Qwen Image 2 Pro corrige esas carencias tratando la tipografía como un elemento estructural y no como un añadido posterior. En la práctica, prompts como "un cartel de producto con un titular en palo seco en negrita en la parte superior del encuadre" producen titulares legibles. Las letras se colocan donde las describiste, el grosor de la fuente coincide con lo que pediste y el texto se integra con la composición en lugar de flotar torpemente encima de ella.

Esto importa sobre todo en el trabajo comercial: gráficos para redes sociales, carteles de eventos, etiquetas de producto, fondos para diapositivas de presentación. Si tu flujo de trabajo necesita texto dentro de la imagen en lugar de añadirlo en la posproducción, este es uno de los pocos modelos que lo hace viable sin una ingeniería de prompts considerable ni una carga de iteraciones.

Entrada de imagen de referencia

El parámetro image opcional acepta la URL de una foto existente. Cuando la proporcionas, el modelo la usa como ancla visual. Describes los cambios en el prompt y el resultado refleja esos cambios mientras conserva los elementos estructurales de la original.

El grado de transformación depende de lo específico que sea tu prompt y de cuánta divergencia pidas. Un cambio sutil de fondo con el sujeto intacto queda muy limpio. Un rediseño tonal completo a partir de una foto de referencia puede alejarse de la composición original. El modelo interpreta la referencia en lugar de fijarla por completo.

Los prompts negativos funcionan en combinación con la imagen de referencia. Si la foto de origen tiene elementos que quieres excluir del resultado, nombrarlos en el prompt negativo reduce su presencia en el resultado final.

Frasco de cuidado de la piel de lujo sobre una superficie de mármol blanco con un fondo de estudio generado por IA y limpio

Probando la edición precisa: fotografía de producto

Hicimos tres pruebas concretas: sustitución de fondo para una foto de producto, tipografía dentro de una imagen para redes sociales y transferencia de estilo a partir de un retrato de referencia. Cada prueba usó un estilo de prompt y una relación de aspecto distintos para exigir distintas capacidades del modelo.

Resultados de la sustitución de fondo

La prueba: un frasco de producto sobre una superficie de escritorio desordenada, imagen de referencia subida y un prompt que pedía un fondo de estudio de mármol limpio con luz de día suave y difusa desde la izquierda.

El resultado: la textura del mármol resultó realista, con vetas y reflejos de superficie adecuados. La dirección de la luz coincidió con el prompt. La sombra del producto se conservó de la original y se extendió de forma natural sobre la nueva superficie. La separación de bordes entre el producto y el nuevo fondo fue limpia a una resolución de visualización normal, aunque al ampliar al 200% se apreció una ligera falta de nitidez en el borde de la tapa del frasco.

El tiempo de procesamiento rondó los 8 segundos para una salida de 16:9 a resolución estándar. Es competitivo con la mayoría de los modelos alojados en Replicate con esa calidad de salida, sobre todo en tareas que implican procesar imágenes de referencia.

💡 Consejo: al sustituir fondos con una imagen de referencia, usa match_input_image: true para conservar la relación de aspecto original y evitar recortes que corten los bordes del producto de forma inesperada.

Lo que controla el prompt negativo

El prompt negativo no sirve solo para filtrar estilos; funciona como una herramienta de exclusión espacial. En la prueba del producto, añadir "escritorio desordenado, superficie de madera, cables, papeles" al prompt negativo hizo que la sustitución de fondo quedara más limpia desde la primera pasada. Sin él, texturas tenues del escritorio se filtraban a través del mármol en las zonas suaves alrededor de la base del producto.

La fuerza de la respuesta al prompt negativo crece con la especificidad. Términos vagos como "desorden" tuvieron menos efecto que nombrar los elementos reales presentes en la imagen de referencia. Si ves que elementos de tu imagen de referencia persisten en el resultado, descríbelos explícitamente en el prompt negativo en lugar de usar descriptores genéricos.

Diseñador gráfico revisando maquetas tipográficas en una tableta en un espacio de trabajo escandinavo luminoso

Probando la tipografía dentro de las imágenes

Aquí es donde Qwen Image 2 Pro se separa de la mayoría de los modelos de forma medible. La tipografía en las imágenes generadas ha sido un punto de fallo conocido en toda la categoría durante años, y la mayoría de las soluciones todavía requieren superponer el texto en posproducción en lugar de generarlo.

Diseños de carteles que se sostienen

La prueba: generar un cartel de evento para redes sociales con un titular de dos líneas, un subtítulo y una fecha en la parte inferior. Sin imagen de referencia; texto a imagen puro a partir de una única descripción detallada.

El titular se renderizó en la posición correcta. Ambas líneas estaban presentes y eran legibles. El grosor de la fuente mostró una clara diferencia entre el titular y el subtítulo. La fecha de la parte inferior fue legible en cuatro de cada cinco pruebas. Una de las pasadas produjo un par de letras ligeramente fusionado en la tercera palabra del subtítulo.

Para comparar directamente, ejecutar el mismo prompt en Flux Dev produjo caracteres distorsionados o directamente ausentes en todos y cada uno de los intentos. La calidad visual de los elementos que no eran texto en Flux Dev fue muy buena, pero la tipografía fue inservible en todos los casos.

💡 Consejo: para trabajos de cartelería, describe el grosor de la fuente, como negrita, regular o ligera, en lugar de un nombre de tipografía concreto. El modelo responde con más fiabilidad a los descriptores de grosor que a los nombres de familias tipográficas.

Dónde cae la precisión del texto

Las cadenas largas son más difíciles. Con más de unas ocho palabras en un único titular, la precisión se degrada: el espaciado entre letras se vuelve irregular y los glifos individuales a veces se fusionan o se dividen al renderizar. Usar el modelo para elementos de texto cortos y contundentes, y dejar los textos más largos para la edición posterior, da siempre mejores resultados.

La puntuación dentro de las imágenes también es irregular. Los apóstrofos y las comillas aparecen correctamente con menos frecuencia que los caracteres alfanuméricos simples. Si tu texto necesita una puntuación exacta, planea cerrarla en tu software de diseño después de generar la imagen, en lugar de confiar en que el modelo la coloque con precisión.

Vista aérea de la mesa de trabajo de un director de arte con fotos de referencia impresas y una cámara profesional

Cómo usar Qwen Image 2 Pro en PicassoIA

Qwen Image 2 Pro está disponible directamente en PicassoIA sin más preparación que iniciar sesión. No hace falta instalación local ni configurar ningún token de API para un uso básico.

Paso 1: abre la página del modelo

Ve a Qwen Image 2 Pro en PicassoIA. La interfaz muestra el campo principal del prompt arriba, una sección opcional para subir imágenes debajo y los controles de parámetros bajo esa. La disposición es sencilla y toda la configuración se hace en un único panel.

Paso 2: escribe tu prompt

Sé específico en cuatro elementos: sujeto, entorno, dirección de la luz y cualquier texto que quieras en la imagen. Un prompt como "una botella de agua de cristal sobre una superficie de baldosa de cerámica blanca, luz suave de ventana desde la derecha, sombras mínimas, fotografía de producto limpia" da al modelo información espacial suficiente para trabajar con precisión sin restringir en exceso la composición.

Si incluyes texto en la imagen, indícalo explícitamente entre comillas dentro del prompt: titular: "Verano 2025". El modelo recoge las cadenas entre comillas con más regularidad que el texto incrustado como parte de una escena descriptiva. Es el método más fiable para obtener texto legible en el resultado a la primera.

Activa Auto Prompt Expansion para prompts cortos cuando quieras que el modelo complete los detalles de la escena automáticamente. Desactívala cuando necesites un control estricto y no quieras que el modelo añada elementos que no especificaste.

Paso 3: configura la relación de aspecto y los parámetros

Relaciones disponibles: 1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 2:1, 1:2. Para publicaciones en redes sociales, 9:16 o 1:1 funcionan mejor según el formato de la plataforma. Para banners horizontales y cabeceras de sitios web, 16:9. Para maquetas impresas, 4:3 o 3:2.

Si subiste una imagen de referencia y quieres que el resultado coincida con sus dimensiones exactas, activa Match Input Image. Esto anula el ajuste de relación de aspecto y usa las proporciones nativas de la imagen de referencia.

Paso 4: itera con el control de semilla

Fija un valor de semilla en cuanto encuentres un resultado cercano a lo que necesitas. Mantener la misma semilla y hacer cambios pequeños y dirigidos en el prompt te permite moverte entre variaciones de forma controlada, en lugar de obtener resultados aleatorios en cada ejecución.

Esto es especialmente útil para las iteraciones tipográficas: fija la semilla, ajusta el texto en la descripción del prompt y vuelve a generar. La composición general y la luz se mantienen estables mientras cambia el elemento de texto que modificaste. La mayoría de los usuarios llegan a un resultado utilizable en tres a cinco iteraciones con este método.

Primer plano de unas manos con un lápiz digital retocando un render arquitectónico en una tableta de pantalla de alta resolución

Qwen Image 2 Pro frente a Flux Dev: cara a cara

Ambos modelos están disponibles en PicassoIA y ambos gestionan flujos de texto a imagen e imagen a imagen, pero están optimizados para cosas distintas.

CaracterísticaQwen Image 2 ProFlux Dev
Renderizado de textoPreciso para cadenas cortasDistorsionado en la mayoría de los casos
Entrada de imagen de referenciaSí, imagen a imagen completaSí, modo img2img
Relaciones de aspecto9 opciones11 opciones
Tiempo medio de generación~8 segundos~3-5 segundos
Prompt negativoSíNo tiene prompt negativo nativo
Control de semillaSíSí
Expansión automática del promptSíNo
Ideal paraTexto dentro de la imagen, ediciones con referenciaVelocidad, volumen, fotorrealismo

Flux Dev es más rápido y ofrece resultados fotorrealistas excelentes cuando los requisitos de texto no forman parte del encargo. Su arquitectura de 12.000 millones de parámetros produce escenas nítidas y de alta fidelidad a partir de prompts descriptivos, y el modo img2img gestiona bien las transformaciones visuales.

Qwen Image 2 Pro es más adecuado cuando el resultado necesita tipografía legible o cuando trabajas a partir de una imagen de referencia y necesitas transiciones de fondo limpias con los mínimos artefactos en los bordes.

Sirven para flujos de trabajo distintos y no compiten por el mismo hueco. Ejecutar ambos en el mismo proyecto para comparar los resultados de la primera pasada es un enfoque práctico cuando no tienes claro cuál encaja mejor con un encargo concreto.

Oficina abierta de una agencia creativa con un equipo revisando grandes hojas de fotos impresas en pantallas montadas en la pared

Con qué combinarlo

Qwen Image 2 Pro genera a la resolución estándar de generación, en torno a 1 megapíxel según la relación de aspecto elegida. Para entregas comerciales, a menudo querrás una pasada de escalado antes de exportar la versión final.

Para el escalado

Clarity Pro Upscaler es la opción más sólida para los resultados fotorrealistas de Qwen Image 2 Pro. Añade microdetalle que coincide con el estilo fotorrealista del original: textura de la piel, trama de la tela, grano de la superficie. Los resultados se integran de forma natural con lo que genera Qwen Image 2 Pro en lugar de añadir una nitidez artificial por encima.

Para resultados de fotografía de producto con superficies lisas y bordes limpios, Google Upscaler gestiona esos materiales sin añadir ruido de textura artificial que quedaría fuera de lugar sobre el cristal o el metal pulido.

Para una pasada rápida de 4x sin ajustes de calidad, Real ESRGAN procesa con rapidez y gestiona de forma fiable la mayoría de los tipos de salida estándar.

Para limpiar el fondo

Cuando la sustitución del fondo deja artefactos en los bordes o restos tenues de la escena original que se filtran, Remove Background puede aislar limpiamente el sujeto. Úsalo después de la pasada de generación de Qwen Image 2 Pro para obtener un recorte limpio y luego compón el resultado sobre un fondo final en tu software de edición.

💡 Consejo: para fotos de producto, el flujo de trabajo más eficiente es: generar con Qwen Image 2 Pro la composición y la luz, pasar por Remove Background para un recorte limpio y después escalar con P Image Upscale para la entrega. Tres herramientas, unos 30 segundos en total y resultados que funcionan en presentaciones para clientes.

Dos fotografías impresas colocadas una junto a otra sobre una mesa de luz con una lupa de fotógrafo para comparar

Limitaciones reales que conviene conocer

Resolución en el momento de la generación

El modelo genera a resolución estándar. Para uso web, es suficiente. Para impresión en gran formato o situaciones que requieran detalle a sangre completa en A2 o más grande, necesitas una pasada de escalado antes de la entrega. Tenlo en cuenta en tu calendario.

Las cadenas de texto largas se degradan

La precisión del texto baja con la longitud de la cadena. El modelo funciona mejor con elementos de texto cortos y contenidos. Para cualquier texto largo dentro de la imagen, genera la composición visual sin texto y añade el contenido en tu herramienta de diseño después. Así tendrás más control tipográfico en la posproducción que luchando con los límites de renderizado del modelo en cadenas largas.

La fidelidad a la imagen de referencia no es del 100%

El modelo interpreta una imagen de referencia, no la copia. Cuando subes una referencia, espera que el resultado comparta elementos estructurales y características de luz con la original, no que sea una edición directa a nivel de píxel. Si necesitas una edición regional precisa con máscaras explícitas, esa es otra categoría de herramientas.

La expansión del prompt puede sorprenderte

La expansión automática del prompt está activada por defecto. Añade detalles de escena que el modelo deduce de tu descripción corta. Esto puede producir resultados más ricos y completos, o introducir elementos que no pediste. Para trabajos comerciales precisos, desactívala y escribe tu prompt completo a mano para saber exactamente qué estás pidiendo.

3 flujos de trabajo que dan resultados

Fachada de arquitectura brutalista con un detalle preciso de la textura del hormigón con luz de hora dorada

Maquetas de envases de producto: sube la imagen de referencia del envase, describe el fondo y las condiciones de luz objetivo, genera en 4:3 o 3:2 y escala con Clarity Pro Upscaler. Este flujo de trabajo es más rápido que preparar una sesión de estudio física para cada variante de envase y produce resultados que aguantan en presentaciones a clientes y fichas de comercio electrónico.

Gráficos para redes sociales con texto integrado: usa la capacidad de renderizado de texto para gráficos de eventos, cabeceras promocionales o imágenes de anuncios en las que el titular forma parte de la composición y no es una superposición de posproducción. Mantén los titulares por debajo de seis palabras para un renderizado de caracteres limpio y usa el control de semilla para iterar sobre la redacción sin reconstruir la composición visual desde cero.

Transferencias de referencia de estilo: sube una foto con la calidad de luz y tonal que quieres replicar, describe el nuevo sujeto y el entorno, y genera. El modelo traslada las características tonales y la dirección de la luz de la referencia mientras sustituye el contenido por lo que describiste. Es más rápido que igualar la luz a mano en la posproducción y produce resultados con una integración natural entre sujeto y entorno.

Para los casos en los que necesitas redactar y pulir prompts complejos antes de generar, Qwen3.7-Plus en PicassoIA puede ayudarte a construir descripciones de escena detalladas, analizar imágenes de referencia para identificar qué elementos mencionar en tu prompt y averiguar por qué un prompt concreto no produce el resultado que esperas.

Hombre sentado en una cafetería con luz cálida, con el fondo editado por IA sustituyendo una escena de calle concurrida por un interior tranquilo

Pruébalo en PicassoIA

Qwen Image 2 Pro es una herramienta especializada. Gestiona mejor que la mayoría de las alternativas de su nivel el texto dentro de la imagen y la edición con imagen de referencia, y produce resultados fotorrealistas con una calidad que funciona para flujos de trabajo comerciales sin necesitar un procesamiento externo en cada pasada.

Las limitaciones son reales, sobre todo en torno a la longitud de las cadenas de texto y la resolución de generación, pero son predecibles. Una vez que las conoces, puedes diseñar en torno a ellas: mantén los titulares cortos, prevé un paso de escalado y desactiva la expansión automática del prompt para el trabajo preciso. El control de semilla y el prompt negativo te dan suficiente profundidad de iteración para llegar a resultados listos para usar sin lanzar decenas de generaciones.

Si produces contenido en el que la tipografía tiene que ir dentro de la imagen, o si partes de una foto de referencia y necesitas cambios precisos de fondo o de estilo, este modelo merece un sitio en tu flujo de trabajo.

Prueba Qwen Image 2 Pro en PicassoIA ahora. Empieza con una descripción corta de producto y una imagen de referencia de tu biblioteca y mira cómo aguanta la primera pasada. Los parámetros son mínimos y la interfaz es intuitiva, así que puedes hacer tu primera prueba en menos de dos minutos.

También puedes explorar todos los modelos disponibles en PicassoIA para encontrar la combinación adecuada de herramientas de generación, edición y escalado para tu flujo de trabajo creativo.

Compartir este artículo

Elige tu idioma