GPT Image 2 llegó sin hacer ruido y golpeó con fuerza el mundo de la fotografía de producto. En pocas semanas desde que OpenAI abrió el acceso, los equipos de e-commerce, los estudios de marca y los creadores independientes empezaron a usarlo para generar fotos de producto que antes requerían un estudio alquilado y un fotógrafo profesional. Este artículo es una prueba práctica completa: prompts reales, resultados reales y puntuaciones reales en cinco categorías de producto. Sin resultados escogidos a dedo y sin adornos de marketing.
Evaluamos GPT Image 2 para fotografía de producto: prueba completa con perfumes, cuidado de la piel, accesorios, calzado y productos envasados. Cada categoría recibió la misma arquitectura de prompt, los mismos criterios de evaluación y el mismo número de intentos de generación. El objetivo era descubrir en qué destaca de verdad este modelo y dónde te costará tiempo y dinero.

Qué aporta GPT Image 2 a la fotografía de producto
GPT Image 2 es el generador de imágenes multimodal de OpenAI, entrenado con un corpus lo bastante grande como para incluir una parte importante de fotografía comercial y editorial. A diferencia de los sistemas basados solo en difusión, procesa las instrucciones de texto con una comprensión semántica mucho más sólida de lo que significa "fotografía de producto": montajes de iluminación controlados, fondos neutros, proporciones comerciales y legibilidad de las etiquetas.
En la práctica, puedes describir un montaje fotográfico en lenguaje sencillo y obtener algo que parece salido de un encargo entregado a un equipo de estudio, no de una IA que adivina al azar lo que quieres.
Los puntos fuertes del modelo
Tres cosas destacan de inmediato cuando lanzas prompts centrados en productos:
- Seguimiento de instrucciones con un alto nivel de detalle. Escribe "aro de luz directamente encima, superficie de granito mojada, toma aérea cenital" y obtendrás exactamente eso, no una aproximación.
- Renderizado de etiquetas y texto. Este siempre ha sido el talón de Aquiles de los modelos de difusión. GPT Image 2 mantiene el texto de los envases mucho más coherente, aunque todavía no es plenamente fiable para producción.
- Constancia en los fondos blancos. El e-commerce exige blancos limpios. GPT Image 2 los entrega de forma fiable cuando los especificas. Nada de crema con viñeteado ni gris claro con ruido. Limpio.
Qué cambió respecto a los modelos anteriores de OpenAI
El predecesor de GPT Image 2, DALL-E 3, solía alucinar logotipos, deformar las formas de los productos o introducir artefactos alrededor de asas, tapas y bisagras. GPT Image 2 muestra una mejora notable en la geometría del producto y la coherencia de las superficies. Las botellas de vidrio ya no se colapsan sobre sí mismas. Las esferas de los relojes siguen siendo circulares. Las suelas de las zapatillas siguen la curva correcta del calzado.
Dicho esto, este modelo no es perfecto, y los puntos en los que falla son lo bastante constantes como para planificar en torno a ellos.

Nuestra configuración de prueba: productos, prompts y parámetros
Las pruebas estandarizadas son la única forma de obtener una comparación justa. Pasamos cada categoría por la misma plantilla de prompt y puntuamos los resultados con los mismos cinco criterios: precisión de la iluminación, renderizado de texturas, control del fondo, legibilidad del texto y coherencia entre tomas.
Los productos que probamos
| Categoría | Producto | Desafío principal |
|---|
| Perfumería | Frasco de perfume de cristal tallado | Transparencia del vidrio, refracción |
| Cuidado de la piel | Botella de sérum con cuentagotas | Texto de la etiqueta, gotas de líquido |
| Accesorios | Reloj suizo de lujo | Detalle metálico, legibilidad de la esfera |
| Calzado | Zapatillas para correr | Geometría compleja, textura de malla |
| Productos envasados | Bolsa de café de origen único | Superficie mate, registro de impresión |
La arquitectura de prompt que usamos
Cada prompt de la prueba seguía esta estructura:
[Product name and material] + [Surface or background] + [Lighting direction and quality] + [Camera specs] + [Style modifiers]
Ejemplo: "Frasco de perfume de cristal tallado sobre mármol de Carrara blanco, iluminación lateral dramática desde arriba a la izquierda a 30 grados, 85 mm f/1.8 con profundidad de campo reducida, grano de película Kodak Portra 400, fotografía RAW 8K, calidad de estudio comercial."
Estandarizar el prompt elimina de la evaluación la variable de la calidad del prompt. Estás probando el modelo, no tu habilidad para escribir prompts. Esta distinción importa más de lo que reconocen la mayoría de los probadores.
Resultados de calidad de imagen
Precisión de la iluminación
La iluminación es lo primero que revisan los ojos entrenados en cualquier foto de producto, y es donde GPT Image 2 se ganó un respeto real en esta prueba. En las cinco categorías de producto, la dirección de la luz se mantuvo en torno al 90 % de precisión cuando la especificábamos de forma explícita. Cuando pedimos "luz lateral desde arriba a la izquierda", llegó desde arriba a la izquierda. Las sombras caían en la dirección correcta, con una caída natural.
El resultado más impresionante llegó con el frasco de perfume de cristal. Los objetos transparentes y muy reflectantes son notoriamente difíciles para los generadores de IA, porque requieren una refracción precisa, luz cáustica y reflejos que respeten la física de la escena. GPT Image 2 produjo arcos de luz convincentes a través del cristal en el primer intento, en tres de cada cinco ejecuciones. Es un listón importante que superar.
Puntuación de iluminación: 8,5/10. Dirección precisa, caída natural y artefactos mínimos en las superficies de vidrio y metal.
Detalle del producto y renderizado de texturas
La textura de la superficie es donde más se nota la diferencia entre los generadores de IA en el uso comercial. El cuero tiene que parecer cuero. El metal cepillado debe mostrar la dirección del grano. El papel kraft mate necesita microtextura. Así se comportó GPT Image 2 según el tipo de superficie:
| Superficie | Puntuación | Notas |
|---|
| Vidrio | 9/10 | La refracción es convincente; las cáusticas aparecen de forma natural |
| Plásticos mates | 8/10 | La variación de la superficie se lee como material real |
| Metal cepillado | 7,5/10 | La dirección del grano sigue bien la geometría |
| Tela y malla | 6,5/10 | Los tejidos finos a veces quedan suavizados |
| Etiquetas impresas | 6/10 | El texto sencillo se mantiene; los logotipos complejos se deshacen |
Puntuación de textura: 7,8/10. Sólida en la mayoría de los materiales duros; le cuesta el tejido fino de las telas y las marcas con detalles intrincados.

Gestión del fondo
En el e-commerce, el control del fondo no es opcional. Amazon, las tiendas de Shopify y la mayoría de las guías de estilo de los marketplaces exigen blancos limpios o tonos neutros concretos. GPT Image 2 entrega blancos limpios de forma fiable cuando los especificas, y maneja fondos texturizados sencillos (mármol de Carrara, hormigón liso, veta de madera recuperada) con una constancia impresionante.
Donde se desmorona: escenas que requieren plausibilidad física entre el primer plano y el fondo. Un producto "apoyado sobre arena de playa mojada con la marea reflejando el artículo" mostrará incoherencias de perspectiva y conflictos entre sombra y superficie que requieren corrección manual. El modelo no ejecuta una simulación física; extrae su resultado de patrones de entrenamiento, y las escenas naturalistas complejas superan esos patrones con rapidez.
Puntuación de fondo: 8,2/10. Los blancos y las texturas de estudio sencillas son casi perfectos. Los entornos naturalistas complejos requieren refinar el prompt y, a menudo, varios intentos.
GPT Image 2 frente a otros generadores de imágenes con IA
Comparamos GPT Image 2 cara a cara con los generadores que más se usan en los flujos de trabajo de fotografía de producto comercial:
| Característica | GPT Image 2 | Midjourney v6 | Flux 1.1 Pro | SDXL |
|---|
| Seguimiento de instrucciones | Excelente | Bueno | Muy bueno | Medio |
| Renderizado de texto en etiquetas | Bueno | Deficiente | Medio | Deficiente |
| Constancia en fondos blancos | Excelente | Medio | Bueno | Medio |
| Vidrio y transparencia | Muy bueno | Bueno | Bueno | Medio |
| Escenas con varios productos | Medio | Bueno | Bueno | Medio |
| Velocidad por imagen | Moderada | Lenta | Rápida | Rápida |
Dónde gana
Para tomas de un solo producto con estilo de estudio y dirección de luz explícita, GPT Image 2 es actualmente la opción más fiable para usuarios no técnicos que necesitan resultados aptos para uso comercial sin hacer un ajuste fino de un modelo ni crear un LoRA personalizado. La fidelidad a las instrucciones es lo bastante alta como para que un responsable de marca describa un montaje en lenguaje sencillo y obtenga algo que un director creativo aprobará.
Dónde flaquea
Las composiciones con varios productos son la debilidad más clara. Si le pides a GPT Image 2 tres botellas en formación triangular con la orientación de las etiquetas constante, obtendrás resultados aproximadamente correctos, no un control espacial preciso. El razonamiento espacial de Midjourney v6 es más sólido en disposiciones complejas con varios elementos. Flux 1.1 Pro también lo gestiona mejor cuando se combina con una estructura ControlNet.

Dónde se queda corto GPT Image 2
El texto en las etiquetas de producto
Es la limitación de la que más se habla en los círculos comerciales. Aunque GPT Image 2 es mejor que los modelos de difusión generando texto, no es lo bastante fiable para producción cuando la exactitud de la etiqueta es importante desde el punto de vista legal o comercial.
Una marca de cuidado de la piel no puede publicar una imagen generada por IA en la que la lista de ingredientes activos esté revuelta o el nombre de la marca tenga una falta de ortografía sutil. En las tomas principales donde el texto de la etiqueta es visible y crítico, las salidas de GPT Image 2 necesitan como mínimo una revisión visual. En categorías reguladas como alimentación, suplementos y cosmética, prevé componer manualmente las etiquetas reales de producto sobre fondos generados por IA.
Solución práctica: usa GPT Image 2 para tomas atmosféricas, entornos de estilo de vida y escenas de fondo. Compón el producto real fotografiado sobre esas escenas cuando el resultado dependa de la etiqueta.
Coherencia entre tomas
Lanza el mismo prompt tres veces y obtendrás tres interpretaciones distintas. Esta es una propiedad fundamental de los modelos generativos, no un defecto exclusivo de GPT Image 2, pero crea un problema real para la fotografía de catálogo, donde las normas de marca exigen que todas las imágenes de una línea de productos compartan el mismo ángulo de luz, la misma profundidad de fondo y la misma temperatura de color.
Con prompts muy detallados y valores de semilla fijos puedes conseguir cierta coherencia, pero cuesta trabajo. Los estudios profesionales lo resuelven con hojas de toma y montajes físicos repetibles. Los generadores de IA lo resuelven de forma imperfecta, y GPT Image 2 no es una excepción.
Puntuación de coherencia: 6,5/10. La calidad de prompt a prompt es alta; la variación visual de una ejecución a otra es un reto real de producción para el trabajo de catálogo.
Escenas complejas con varios productos
Las tomas de un solo producto funcionan muy bien. Las escenas con tres o más productos y relaciones espaciales concretas funcionan mal, y suelen dar geometrías fusionadas, escalas incoherentes o productos que parecen flotar de un modo que rompe la verosimilitud. Para las imágenes principales de banner con toda una línea de productos, prepárate para hacer una posproducción considerable o usa el resultado de la IA solo como maqueta de composición aproximada.

Cómo hacerlo en PicassoIA ahora mismo
PicassoIA te da acceso a GPT Image 2 a través de su plataforma de generación de imágenes, sin necesidad de credenciales de API ni configuración técnica. El valor real de producción llega al combinar los resultados de GPT Image 2 con el ecosistema de posproducción de PicassoIA.
Generar tomas de producto paso a paso
- Escribe tu prompt con la plantilla:
[Product + material] on [surface or background], [lighting setup], [camera specs], RAW 8K photography, photorealistic.
- Fija la relación de aspecto en 16:9 para banners de catálogo, o 1:1 para miniaturas de marketplace.
- Activa el prompt upsampling si tu prompt inicial es breve. El sistema lo enriquecerá automáticamente con detalles propios de la fotografía.
- Revisa el resultado frente a las normas de tu marca antes de usarlo en producción.
- Vuelve a generar con un valor de semilla fijo para iterar sobre un resultado prometedor sin empezar de cero.
Después de la toma: escalar y eliminar fondos
Los resultados de generación estándar rara vez están listos para producción sin dos pasos de posproducción: la eliminación del fondo y el escalado de resolución.
Eliminación del fondo
El modelo Bria Remove Background recorta los sujetos de forma limpia, sin los bordes difusos habituales en las herramientas de segmentación más antiguas. En productos de vidrio con transparencia parcial, gestiona bien los gradientes de opacidad en lugar de crear un recorte binario duro que destruya el efecto del cristal.
Escalado para impresión y pantallas de alta densidad
Las salidas estándar de IA suelen ser de 1024x576 píxeles en 16:9. Para impresión o aplicaciones digitales de alta resolución, eso no basta. Dos modelos manejan bien el escalado para la fotografía de producto:
- Clarity Pro Upscaler: el mejor de su clase para texturas fotorrealistas. Añade microdetalle real en lugar de una simple interpolación. Primera opción para cualquier producto en el que la textura de la superficie sea un argumento de venta.
- Topaz Image Upscale: capaz de escalar 6x con un control sólido de artefactos. Úsalo cuando necesites una salida con resolución de impresión a partir de una imagen de origen de tamaño web.
Para trabajos de catálogos de comercio electrónico en concreto, Bria Increase Resolution ofrece escalado de hasta 4x con una salida limpia y sin artefactos, que conserva el texto de las etiquetas de los productos mejor que la mayoría de alternativas. Y como punto de partida gratuito, Real ESRGAN ofrece un escalado 4x sólido sin sobrecosto, aunque es más conservador con el detalle de textura que Clarity Pro.

Juntando las puntuaciones
| Criterio | Puntuación | Peso | Puntuación ponderada |
|---|
| Precisión de la iluminación | 8,5 | 25 % | 2,13 |
| Textura de la superficie | 7,8 | 20 % | 1,56 |
| Control del fondo | 8,2 | 20 % | 1,64 |
| Texto y etiquetas | 6,0 | 15 % | 0,90 |
| Escenas con varios productos | 5,5 | 10 % | 0,55 |
| Coherencia entre tomas | 6,5 | 10 % | 0,65 |
| Total ponderado | | | 7,43/10 |
GPT Image 2 se sitúa en 7,4 sobre 10 para la fotografía de producto comercial cuando ponderas los criterios según lo que realmente importan en el día a día del e-commerce y del trabajo de marca. Es un resultado sólido para un modelo generalista usado en una aplicación especializada. El techo es más alto en categorías concretas (productos individuales de cristal o metal en montajes de estudio) y más bajo en otras (sesiones de catálogo completas, envases con mucho peso en la etiqueta).
💡 Conviene saber: La media de 7,4 oculta una distribución bimodal. Para productos individuales de superficie dura en montajes de estudio, GPT Image 2 se acerca más a 9. En escenas de estilo de vida con varios productos y envases donde la etiqueta es crítica, baja hasta acercarse a 6. Saber en qué categoría encajan tus productos es lo más útil que te llevas de esta prueba.

Qué significa esto para tu flujo de trabajo
Si diriges una tienda de e-commerce, un estudio de marca o haces fotografía de producto para clientes, GPT Image 2 cambia la ecuación en un tipo concreto de sesión: imágenes de un solo producto, con estilo de estudio, iluminación controlada y fondos limpios.
Para esas tomas, la generación con IA te lleva al 80 % de una imagen lista para producción en minutos, no en horas. El 20 % restante es eliminación de fondo, escalado de resolución y verificación de etiquetas. Ese 20 % es exactamente donde las herramientas de posproducción de PicassoIA hacen el trabajo de forma eficiente, sin salir de la plataforma.
Para escenas complejas con varios productos, composiciones de estilo de vida con personas o tomas de envases con etiquetas críticas, GPT Image 2 es un punto de partida potente y una herramienta de maquetas de composición, no un sistema de salida final. Tener la expectativa correcta te ahorra tiempo y evita frustraciones.
Recomendación práctica: usa GPT Image 2 en PicassoIA para tomas principales de producto, fondos de estilo de vida y contenido de catálogo por lotes en categorías donde la legibilidad de la etiqueta no sea legalmente crítica. Crea un paso de control de calidad para todo lo que vaya directamente a un marketplace o a un minorista.

Pruébalo con tus propios productos
La forma más rápida de comprobar si GPT Image 2 funciona para tu categoría de producto concreta es lanzar tres o cuatro variaciones de prompt y medirlas frente a tu producción fotográfica actual. La inversión de tiempo son minutos. El posible retorno son días de estudio ahorrados en cada renovación de catálogo.
PicassoIA te da acceso a GPT Image 2 junto con otros 91 modelos de texto a imagen, así que puedes probar el mismo prompt en varios generadores y encontrar el que mejor funciona para tu tipo de producto y tus normas de marca. Después de generar, tienes disponible el conjunto completo de herramientas de posproducción: escalado con Clarity Pro Upscaler o Recraft Crisp Upscale, eliminación de fondo con Bria Remove Background, y escalado de resolución mediante Upscaler de Google cuando necesites un estilo de escalado distinto para un tipo de producto concreto.
Empieza con un producto, un montaje de iluminación y cinco variaciones de prompt. Los resultados te dirán exactamente qué puede y qué no puede hacer GPT Image 2 para tu flujo de producción. Tendrás imágenes reales que evaluar en lugar de una estimación teórica, y sabrás en una hora si encaja en tu proceso.
