Reseña de GPT Image 1.5: ¿vale la pena tanto revuelo?

GPT Image 1.5 llegó prometiendo más realismo, mejor fidelidad al prompt y menos artefactos que su predecesor. Lo probamos con retratos, arquitectura, fotografía de producto y escenas estilizadas para ver dónde destaca y dónde las alternativas de PicassoIA ya lo superan en todas las métricas que importan para los flujos de trabajo de contenido profesional.

Reseña de GPT Image 1.5: ¿vale la pena tanto revuelo?
Cristian Da Conceicao
Fundador de Picasso IA

GPT Image 1.5 llegó en 2025 con promesas que dieron que hablar en todos los foros de diseño y comunidades de IA en internet. Más realismo. Mejor fidelidad al prompt. Menos artefactos que el modelo GPT Image original. Tras varias semanas probándolo con sesiones de retratos, prompts de arquitectura, escenarios de fotografía de producto, pruebas de texto dentro de la imagen y composiciones complejas con varios sujetos, el panorama está mucho más claro de lo que sugiere el marketing de OpenAI. Esta reseña desglosa lo que GPT Image 1.5 hace realmente bien, dónde se queda corto de formas que importan en flujos de trabajo reales y si el costo se justifica cuando las alternativas ya igualan o superan su calidad sin las restricciones.

Lo que GPT Image 1.5 ofrece realmente

GPT Image 1.5 es el modelo de generación de imágenes más reciente de OpenAI, basado en la arquitectura GPT-4o y disponible tanto como endpoint de API como función integrada en las suscripciones ChatGPT Plus y Pro. Cada generación consume créditos de API o cuenta contra tu límite mensual de uso. No hay un nivel gratuito para trabajo de volumen serio.

Cambios principales respecto al original

El primer modelo GPT Image introdujo el primer intento de OpenAI de renderizar texto de forma nativa dentro de las imágenes, algo que DALL-E 3 hacía mal en casi todos los casos. GPT Image 1.5 parte de esa base con una serie de mejoras concretas que son reales, aunque no revolucionarias:

  • Renderizado de texto más nítido en logotipos, señalética y frases cortas
  • Mejor coherencia de la iluminación en escenas con más de una fuente de luz
  • Mejor anatomía de las manos, el punto históricamente débil de todos los modelos basados en difusión
  • Velocidad de salida más alta, con una media de 15 a 20 segundos para la resolución estándar de 1024x1024
  • Composiciones con varios sujetos más estables, donde los objetos y las personas ya no se fusionan al azar

💡 Conviene saberlo: GPT Image 1.5 genera de forma nativa solo en cuadrado (1:1), retrato (1024x1792) o paisaje (1792x1024). Para imágenes 16:9 reales, necesitas recortar manualmente, lo que hace perder parte del sujeto, o usar outpainting, que puede introducir costuras visibles.

Para quién lo diseñó OpenAI

El modelo está claramente pensado para equipos de producto, departamentos de marketing y desarrolladores que necesitan generación de imágenes reproducible a través de una API estable. La integración con el prompt de sistema permite que GPT Image 1.5 siga conjuntos de instrucciones de varios turnos, lo que lo hace útil en flujos iterativos en los que refinas una imagen mediante una conversación.

La contrapartida es un filtrado de contenido muy visible. Las barreras son claramente más estrictas que las de las alternativas de código abierto, lo que genera fricción real para la fotografía de moda, el trabajo editorial y cualquier contenido que se mueva en la categoría de lo estilísticamente audaz pero profesionalmente legítimo.

Resultados de generación de imágenes con IA vistos en la pantalla de un teléfono

Generación de retratos y rostros

Los rostros siempre han sido el punto de referencia más difícil para los generadores de imágenes con IA. GPT Image 1.5 mejora mucho frente a la generación anterior, pero el techo es más bajo que el de las alternativas de código abierto que funcionan a plena capacidad.

Donde los rostros parecen reales

En retratos frontales y de tres cuartos con una iluminación bien especificada, GPT Image 1.5 produce resultados impresionantes. Los tonos de piel son creíbles, los ojos reflejan correctamente los brillos especulares y los mechones de pelo se distinguen individualmente, en lugar de formar la masa borrosa que lastraba a los modelos anteriores.

El modelo maneja la diversidad de tonos de piel mejor que la mayoría de los competidores centrados en la API. Los prompts que especifican tonalidades más oscuras producen una distribución precisa de la melanina, sin los subtonos grises y turbios que aparecen en varios modelos de código abierto cuando no se usan checkpoints especializados. Las pecas, los lunares y las cicatrices leves se representan de forma constante cuando se describen.

La iluminación en los rostros es donde GPT Image 1.5 muestra su mejora más notable. La luz Rembrandt, la luz dividida y la luz de ventana con una caída realista se trasladan del prompt a la imagen con bastante precisión. El modelo entiende que la luz envuelve los rostros en lugar de incidir de forma plana sobre ellos.

Donde los rostros todavía fallan

Las fotos de grupo con más de tres sujetos empiezan a mostrar incoherencias en las proporciones faciales. La forma de las orejas parece genérica en distintos sujetos. Los dientes en sonrisas con la boca abierta tienen una uniformidad inquietante que, vistos de cerca, resulta artificial.

Los perfiles son su mayor debilidad. El lateral de la nariz y la colocación de la oreja se desalinean con frecuencia en ángulos de 90 grados, algo que se vuelve obvio al hacer zoom para revisar la calidad antes de publicar.

La representación de la edad es irregular. Pedir "una persona de 60 años" a veces devuelve un rostro que parece de mediados de los 40, con la piel algo cansada, en lugar de rasgos genuinamente envejecidos con la complejidad de textura de la piel mayor.

El problema de las manos (parcialmente resuelto)

La anatomía de las manos era el fallo más visible del modelo anterior. GPT Image 1.5 aborda de verdad los casos más flagrantes. Las manos con seis dedos ya son raras. Las proporciones de los dedos en manos relajadas y abiertas se ven naturales en la mayoría de los resultados.

Donde todavía falla: los dedos que agarran objetos cilíndricos (tazas, bolígrafos, barandillas), las manos parcialmente ocultas y las manos en ángulos de escorzo poco habituales siguen produciendo errores. La corrección es real, pero concreta. Las posiciones complejas de la mano siguen siendo poco fiables.

Retrato fotorrealista generado con IA con detalle nítido de la textura de la piel

Arquitectura y fotografía de producto

Este es el terreno en el que GPT Image 1.5 se gana su reputación y justifica una consideración seria.

Composición de escenas

Los prompts de arquitectura producen de forma constante resultados que pueden engañar a un espectador casual. Los espacios interiores modernos con fuentes de luz mixtas, las fotos exteriores de edificios con una perspectiva atmosférica precisa y las escenas de calles urbanas con una geometría correcta de punto de fuga se resuelven con seguridad.

El modelo interpreta correctamente la profundidad espacial en la mayoría de los casos, colocando los objetos a distancias coherentes y escalándolos proporcionalmente a la escena. Mantiene la coherencia de la perspectiva entre los elementos del primer plano, el plano medio y el fondo mejor que la mayoría de los competidores en este rango de precio.

El renderizado de materiales en contextos arquitectónicos es especialmente sólido. La textura del hormigón, los reflejos del vidrio, las superficies de metal cepillado y los paneles de madera se perciben como materiales concretos y no como aproximaciones genéricas de ellos.

Fotografía de producto

Para tomas aisladas de producto sobre fondos sencillos, GPT Image 1.5 es realmente útil. Las superficies reflectantes de la electrónica, el patrón de grano de los artículos de piel, el aspecto esmerilado del envase de vidrio y las diferencias de acabado mate frente a brillante en los plásticos se renderizan con propiedades materiales convincentes.

El diseño de envases sale especialmente bien cuando el prompt describe con precisión la forma del recipiente, el material y el tratamiento de la superficie. Un prompt como "cilindro de aluminio negro mate con tapa cepillada, luz de estudio suave desde arriba a la izquierda, fondo blanco, fotografía de producto" produce con fiabilidad una toma que un equipo de producto podría usar como maqueta conceptual.

💡 Consejo profesional: Describe las propiedades del material en lugar de los nombres de los productos. "Frasco de perfume de cristal esmerilado con bomba de spray dorada" supera a "frasco de Chanel N.º 5" siempre, porque el modelo renderiza a partir de su comprensión de los materiales en lugar de adivinar formas patentadas.

El problema de la resolución 16:9

Casi todos los casos de uso profesionales requieren imágenes 16:9 para miniaturas de YouTube, secciones principales de sitios web, cabeceras de redes sociales y publicidad digital. GPT Image 1.5 no genera de forma nativa esta relación de aspecto.

Tus opciones son recortar y perder contenido por los laterales, o usar outpainting a través de la API para extender la imagen. El outpainting funciona, pero añade un paso al flujo de trabajo y puede producir incoherencias visibles en la unión de la extensión, sobre todo con fondos complejos que tienen gradientes de luz marcados.

Flujo de trabajo con dos monitores para comparar resultados de generación de imágenes con IA

Dónde GPT Image 1.5 todavía decepciona

Los puntos positivos son reales. Las frustraciones también.

Renderizado de texto: mejor, pero no resuelto

OpenAI presentó la mejora del renderizado de texto como una mejora estrella de GPT Image 1.5. Para frases cortas en tipografías sans-serif grandes y limpias, funciona con fiabilidad. Para cualquier cosa más exigente:

  • Las palabras de más de 8 a 10 caracteres empiezan a sustituir letras de forma irregular
  • El texto curvo en etiquetas de producto y logotipos circulares sigue siendo poco fiable
  • El kerning y el espaciado entre caracteres se ven irregulares en tamaños pequeños dentro de la imagen
  • Las escrituras no latinas producen una precisión mucho menor que el inglés
  • El texto de varias líneas con tamaños mezclados suele perder la alineación

Si tu flujo de trabajo requiere texto preciso dentro de las imágenes para señalética, envases o maquetaciones editoriales, GPT Image 1.5 ha mejorado, pero todavía no es una solución de producción para casos exigentes.

Deriva del prompt en escenas complejas

Dale a GPT Image 1.5 una escena con cinco o más elementos específicos y eliminará o modificará algunos de ellos con regularidad. "Una mujer leyendo un libro rojo en una mesa de café de madera con una planta verde en maceta a su lado y un paraguas amarillo visible por la ventana de detrás" tiende a producir tres o cuatro elementos correctos de cinco.

Esto no es exclusivo de GPT Image 1.5, ya que la deriva del prompt es un problema de toda la industria, pero los competidores han avanzado de forma más medible últimamente. El problema es peor en escenas dominadas por retratos, donde el modelo prioriza que el rostro salga bien y resta precisión al fondo.

La realidad del costo

PlanCosto mensualGeneraciones aproximadas
ChatGPT Plus$20/mes~500 imágenes estándar
ChatGPT Pro$200/mesIlimitadas (con limitación de velocidad)
API calidad estándar~$0.04 por imagenPago por uso
API alta calidad~$0.12 por imagenPago por uso

Para usuarios particulares que generan imágenes de forma ocasional, el plan Plus es razonable. Para estudios o equipos de contenido que hacen cientos de iteraciones por proyecto, los costos crecen de forma incómoda, y la limitación de velocidad del plan Pro es más agresiva en la práctica de lo que sugiere la documentación. Los precios de la API varían según la resolución y el nivel de calidad, lo que complica más de lo debido estimar costos para planificar el presupuesto.

Profesional creativo trabajando hasta tarde revisando resultados de IA en un monitor grande

El problema de las restricciones de contenido

GPT Image 1.5 se rige por la política de contenido de OpenAI, que es claramente más restrictiva que las alternativas de código abierto y que muchos productos de API competidores. Para fotógrafos profesionales, editores de moda y directores creativos cuyo trabajo incluye glamour, moda de baño editorial, campañas de belleza o sujetos humanos artísticamente audaces, el comportamiento de rechazo del modelo genera fricción real en la producción.

Lo que hace esto más frustrante que un simple desacuerdo con la política es la incoherencia. Prompts que se generan sin problemas en un intento a veces devuelven rechazos en un segundo intento idéntico. La interpretación que hace el modelo de lo que queda fuera de la política no es determinista, lo que hace imposible predecir con fiabilidad si una dirección creativa concreta funcionará a lo largo de todo un proyecto.

GPT Image 1.5 frente a la competencia

Así se compara GPT Image 1.5 con las alternativas más relevantes para uso profesional, según los criterios que de verdad afectan al trabajo diario:

CriterioGPT Image 1.5P-ImageSDXL de código abierto
Realismo de retratosMuy buenoExcelenteBueno
Salida nativa 16:9NoSíSí
Renderizado de textoBuenoBuenoDeficiente
Flexibilidad de contenidoRestringidoFlexibleTotalmente abierto
Costo por 100 imágenesDe $4 a $12Incluido en el planSolo hardware
Acceso a la APISíSíAutoalojado
Velocidad mediaDe 15 a 20 segundosDe 8 a 15 segundosVariable
OutpaintingMediante APIIntegradoMediante extensión

P-Image como alternativa directa

P-Image en PicassoIA merece una atención especial porque compite directamente en las métricas que más importan a los estudios de contenido y a los equipos creativos. Está optimizado para resultados fotorrealistas, con especial fuerza en la fotografía de retrato, el trabajo editorial de estilo de vida y las composiciones cinematográficas.

Donde GPT Image 1.5 restringe el contenido y cobra por generación, P-Image da a los profesionales creativos más margen, con una velocidad de generación que iguala o supera la de OpenAI. La salida nativa 16:9 elimina por completo el paso de recorte.

💡 Diferencia práctica: Para un equipo de contenido que genera 200 imágenes al mes en alta calidad, GPT Image 1.5 a través de la API cuesta aproximadamente $24. El mismo volumen en PicassoIA está cubierto por la suscripción a la plataforma, sin facturación por imagen.

Diseñador comparando fotos impresas generadas con IA sobre una mesa luminosa

Escalado y nitidez de tus resultados

Un aspecto en el que la plataforma que usas importa tanto como el modelo de generación es la resolución del post-procesado. GPT Image 1.5 genera como máximo 1024 px o 1792 px. Para trabajos de impresión, formatos de gran tamaño o fotografía de producto detallada donde los clientes harán zoom, necesitas escalado con reconstrucción de detalle, no solo interpolación.

Herramientas de superresolución que funcionan de verdad

PicassoIA ofrece modelos de escalado dedicados, optimizados para distintos casos de uso:

Clarity Pro Upscaler añade detalle generado durante el proceso de escalado en lugar de limitarse a estirar píxeles. En imágenes de retrato, esto significa una textura de piel más orgánica que la generación base. En fotografía de producto, afina los bordes de la superficie de los materiales hasta el punto de que los resultados en resolución web se vuelven aptos para impresión.

Topaz Image Upscale de Topaz Labs admite una ampliación de hasta 6x con reconstrucción inteligente del detalle. Si preparas imágenes generadas con IA para campañas publicitarias o pantallas de gran formato donde el espectador estará a un metro de distancia, esta es la herramienta adecuada. La conservación del detalle en ratios de escalado extremos es realmente distinta de la interpolación bicúbica estándar.

Real ESRGAN es el upscaler de código abierto consolidado que maneja tanto imágenes fotorrealistas como estilizadas sin añadir el halo de sobreafilado que producen muchos upscalers de IA en los bordes de los objetos. Es rápido y fiable para aumentos de resolución rápidos.

P Image Upscale se combina directamente con las generaciones de P-Image porque está ajustado a las características de salida del modelo. Usar un upscaler compatible en lugar de uno genérico conserva las cualidades tonales y de textura de la imagen base, en lugar de introducir una firma visual diferente.

Lupa examinando una foto de retrato generada con IA hiperdetallada sobre una mesa de luz

De las imágenes fijas al contenido en video

La generación de imágenes fijas es solo una parte de un flujo de producción de contenido moderno. Una vez que tienes una imagen principal sólida, ya sea de GPT Image 1.5 o de P-Image, el siguiente paso lógico para redes sociales, demostraciones de producto y publicidad de pago es la animación.

Seedance 2.5 de ByteDance crea videos de hasta 30 segundos con audio sincronizado nativo, lo que lo convierte en la opción adecuada para contenido de lanzamiento de productos y campañas sociales que necesitan movimiento sin una pasada de audio aparte. Para un movimiento cinematográfico a partir de una imagen fija, Wan 2.7 I2V ofrece imagen a video con precisión de fotograma y física realista en los elementos en movimiento. LTX 2 Pro genera video 4K directamente desde prompts de texto, salvando la distancia entre las campañas de imágenes estáticas y el contenido en movimiento completo sin necesidad de una imagen de origen.

💡 Flujo de trabajo que funciona: Genera una imagen principal de producto con P-Image, pásala por Clarity Pro Upscaler para obtener una resolución apta para impresión y luego anímala con Seedance 2.5 para publicidad en redes y medios digitales. Eso es un conjunto completo de recursos a partir de una sola sesión de prompts.

Interior de un estudio fotográfico moderno con una impresión de gran formato generada con IA

Obtener mejores resultados que GPT Image 1.5 ahora mismo

Si ahora usas GPT Image 1.5 y chocas con sus límites, así puedes pasar a un flujo de trabajo que elimina la mayoría de esos puntos de fricción sin rehacer todo tu proceso desde cero.

Paso 1: ejecuta los mismos prompts en P-Image

Visita P-Image en PicassoIA y ejecuta tus prompts con la misma profundidad descriptiva que usarías para GPT Image 1.5. Los principios de prompting que funcionan allí funcionan aquí. Lo que cambia es la salida:

  • Especifica la relación de aspecto de forma explícita, incluida la 16:9, que funciona de forma nativa
  • Usa referencias de lentes de cámara (85 mm, 50 mm, 35 mm gran angular) para controlar el realismo
  • Incluye referencias de películas fotográficas (Kodak Portra 400, Fuji Superia 400) para el carácter del color
  • Describe la dirección y la calidad de la luz en lugar de solo su intensidad

Paso 2: escala para la entrega profesional

Lleva tus mejores generaciones a Topaz Image Upscale o a Clarity Pro Upscaler, según el uso final. El uso web y las redes sociales toleran un escalado de 2x sin artefactos. El trabajo de impresión o la visualización en gran formato se benefician de 4x a 6x con reconstrucción activa del detalle.

Paso 3: elimina los fondos en el trabajo de producto

Para las tomas de producto que van a fichas de comercio electrónico o maquetaciones compuestas, la herramienta de eliminación de fondo de PicassoIA gestiona las imágenes generadas con IA de forma limpia. Aísla correctamente los sujetos tanto en imágenes estilizadas como fotorrealistas, sin los artefactos de borde que aparecen cuando las herramientas genéricas se encuentran con los bordes blandos típicos de la IA.

Paso 4: anima para contenido en movimiento

¿Tienes imágenes fijas entre tus mejores resultados? Conviértelas en video con Wan 2.7 I2V para un movimiento cinematográfico o con Seedance 2.5 para contenido que necesita audio nativo junto al movimiento.

Creadora de contenido revisando una cuadrícula de imágenes de IA en una tableta con luz de mañana

La verdad sin adornos sobre GPT Image 1.5

GPT Image 1.5 es un modelo sólido de una empresa con muchos recursos de investigación detrás. La mejora del realismo de los retratos frente al original es real. La salida de arquitectura y fotografía de producto es realmente impresionante para una herramienta centrada en la API. Las correcciones de anatomía de las manos son significativas, aunque incompletas.

Pero no opera en el vacío. El costo por generación se acumula con el volumen de producción. Las restricciones de contenido generan fricción en el trabajo creativo profesional. La ausencia de salida nativa 16:9 añade un paso al flujo de trabajo que las plataformas competidoras ya han eliminado.

Si ya estás muy metido en el ecosistema de OpenAI y necesitas imágenes de producto o de arquitectura con un comportamiento fiable de la API, GPT Image 1.5 se gana su sitio en tu conjunto de herramientas.

Si estás construyendo un flujo de trabajo de contenido desde cero, necesitas salida 16:9 sin pasos de post-procesado, quieres margen creativo para trabajos audaces pero profesionales, o generas en volumen donde el costo por imagen importa, las herramientas de generación de imágenes de PicassoIA ofrecen una alternativa convincente que iguala o supera a GPT Image 1.5 en la mayoría de los criterios que afectan a la calidad diaria del resultado.

Prueba tu próximo prompt con P-Image en PicassoIA y pon los dos resultados uno al lado del otro. La plataforma reúne más de 91 modelos de texto a imagen, upscalers dedicados para impresión y web, eliminación de fondo y un conjunto completo de generación de video desde el mismo espacio de trabajo. Lo que antes requería cuatro suscripciones separadas, recargas de créditos y pestañas del navegador ahora funciona desde un único lugar, con un solo inicio de sesión y una estructura de costos que tiene sentido para el volumen profesional.

Compartir este artículo

Elige tu idioma