GPT Image 1.5: cómo crear fotos de IA que parezcan reales
GPT Image 1.5 es lo más parecido a una cámara real que la IA ha producido jamás. Este artículo desglosa las estructuras de prompt exactas, el lenguaje de cámara, el vocabulario de iluminación y los enfoques por tipo de sujeto que separan las imágenes que parecen reales de las que claramente no lo parecen.
GPT Image 1.5 no se parece a la mayoría de los modelos de imagen de IA. No renderiza. Fotografía. La diferencia es sutil hasta que la ves, y entonces ya no puedes dejar de verla: la forma en que la piel capta la luz, la forma en que un fondo desenfocado sigue pareciendo un espacio físico, la forma en que los objetos tienen peso. Este artículo trata de cerrar la brecha entre "claramente IA" y "podría ser una foto" usando GPT Image 1.5, y de darte los marcos exactos para lograrlo.
Qué es realmente GPT Image 1.5
No es solo otro modelo de texto a imagen
La mayoría de los generadores de imágenes están entrenados para producir resultados bonitos. GPT Image 1.5 está entrenado para producir resultados precisos. Surgió de la cadena de investigación multimodal de OpenAI, la misma línea que dio a GPT-4o la capacidad de razonar sobre entradas visuales. Ese trasfondo importa: el modelo estuvo expuesto a cómo funciona de verdad la fotografía real (la distorsión de perspectiva, el comportamiento de las lentes, la caída de profundidad, la neblina atmosférica), no solo a cómo se ven las fotos.
El resultado es un modelo que maneja la lógica fotográfica mejor que casi cualquier otra opción disponible. Pídele un retrato de 85 mm y comprimirá el fondo como lo hace de verdad un 85 mm. Pídele luz de la mañana y calculará dónde caen las sombras con ese ángulo. Este comportamiento no es casual: es una comprensión aprendida de la realidad física.
En qué se diferencia de las versiones anteriores
Los modelos de imagen anteriores de OpenAI destacaban en ilustración, arte conceptual y narrativa visual. GPT Image 1.5 desplaza el foco con fuerza hacia el fotorrealismo y el seguimiento de instrucciones. Donde DALL-E 3 podría interpretar "una mujer leyendo junto a una ventana" con suavidad pictórica, GPT Image 1.5 la renderiza con una precisión documental: la veta de la repisa de madera, el ligero reflejo en el cristal, la forma en que su pelo cae en tres dimensiones.
También maneja el espacio negativo y la composición de forma más deliberada. El modelo parece entender que lo que no aparece en el encuadre importa tanto como lo que sí aparece. Es una intuición fotográfica que la mayoría de los otros modelos no tienen.
Por qué las fotos de IA todavía parecen falsas
Las 5 pistas delatoras
Incluso con los mejores modelos, la mayoría de las imágenes de IA no superan la prueba de realismo. Esto es lo que pasa:
Problema
Cómo se ve
Por qué ocurre
Piel demasiado suave
Textura de plástico, sin poros
Los modelos promedian las imperfecciones
Bokeh uniforme
El desenfoque del fondo es perfectamente homogéneo
No se comprende la óptica del objetivo
Lógica de sombras errónea
Sombras que vienen de ángulos imposibles
Modelado incoherente de la fuente de luz
Reflejos inquietantes en los ojos
Brillos simétricos o artificiales
Interpolados a partir de varias fuentes
Composición demasiado perfecta
Centrada, estática, limpia como en Instagram
Sesgo del entrenamiento hacia imágenes "bonitas"
Lo que el modelo no puede arreglar por sí solo
GPT Image 1.5 corrige muchos de estos problemas automáticamente, sobre todo la lógica de sombras y el comportamiento de las lentes. Pero la textura de la piel, la variedad de composición y el grano son áreas en las que el prompt lleva el peso. El modelo no añadirá imperfecciones a menos que se lo pidas. No disparará desde un ángulo bajo si no lo especificas. No añadirá grano de película si no nombras el tipo de película. Tienes que hablar su idioma.
💡 La idea clave: las fotos reales son imperfectas. Tus prompts deben pedir la imperfección de forma explícita. Si tu prompt suena a texto publicitario, el resultado parecerá una foto de banco de imágenes.
Cómo construir un prompt fotorrealista
La fórmula básica del prompt
La mejora más grande que puedes hacer en tus prompts es añadir cuatro capas de especificidad: Sujeto, Entorno, Luz y Cámara. La mayoría de la gente acierta con el sujeto y descuida las otras tres.
[Subject with natural imperfection] + [Specific environment with texture details] + [Named light source, direction, and quality] + [Camera model, lens, f-stop, ISO] + [Film stock or color grade] + [--ar 16:9 --style raw]
Aquí tienes un antes y un después:
Débil: Una mujer sentada junto a una ventana
Fuerte: Una mujer de unos veintitantos años con pecas naturales y el pelo ligeramente despeinado por el viento, sentada junto a una ventana de suelo a techo en un apartamento minimalista de Tokio a las 4 de la tarde en un día nublado, luz gris difusa que llena la escena desde la izquierda sin sombras duras, disparada con una Sony A7IV y una lente de 85 mm f/1.8, gradación de color Kodak Portra 400, grano de película visible, --ar 16:9 --style raw
El segundo prompt no deja al modelo margen para recurrir a algo genérico.
Lenguaje de cámara y lente que funciona
Esta es la herramienta más desaprovechada en la ingeniería de prompts para el fotorrealismo. Las distintas lentes crean imágenes fundamentalmente diferentes, y GPT Image 1.5 entiende esas diferencias.
Lente
Efecto
Mejor para
24 mm f/2.8
Amplia, con ligera distorsión en los bordes
Arquitectura, interiores, entorno
50 mm f/1.8
Perspectiva natural, compresión plana
Calle, documental, retratos informales
85 mm f/1.4
Fondo comprimido, bokeh precioso
Retratos íntimos, primeros planos
135 mm f/2.0
Compresión fuerte, profundidad de campo reducida
Retratos centrados en el detalle, sujetos lejanos
Combina siempre la lente con un cuerpo de cámara real: Sony A7IV, Nikon Z8, Canon R5, Leica M11. Esto ancla el modelo a las convenciones de la fotografía profesional en lugar de a la estética genérica de "foto".
Vocabulario de iluminación que lo cambia todo
"Buena iluminación" es la frase más inútil de la ingeniería de prompts. El lenguaje de iluminación específico produce resultados específicos y que parecen reales.
Usa este vocabulario:
Dirección: desde arriba a la izquierda, desde directamente detrás, desde un ángulo bajo de 30 grados
Calidad: sol directo y duro, difusión suave de día nublado, brillo cálido de tungsteno en interiores, rayos volumétricos de hora dorada
Interacción con el sujeto: creando un halo natural a través del pelo, proyectando sombras con volumen sobre los pómulos, llenando la escena con rebote ambiental de una pared blanca
Temperatura de color: luz de día de 5500 K, calidez de vela de 2800 K, la calidad gris azulada de una mañana de invierno
💡 Consejo profesional: combina una fuente de luz principal con un relleno secundario, igual que haría un fotógrafo real. Ejemplo: "Luz principal: sol duro de la tarde desde la derecha que crea sombras fuertes. Relleno: rebote ambiental suave de un suelo de hormigón claro."
Usar GPT Image 1.5 en PicassoIA
GPT Image 1.5 está disponible directamente en PicassoIA, donde puedes ejecutarlo sin necesidad de acceso a la API, configuraciones de facturación ni un entorno de desarrollo. Así se consiguen los mejores resultados con el modelo en la plataforma.
Escribe tu prompt siguiendo la fórmula de arriba: Sujeto + Entorno + Luz + Cámara
Fija la relación de aspecto en 16:9 para escenas cinematográficas, 4:5 para retratos y 1:1 para fotos de producto
Incluye modificadores de estilo al final: --style raw indica fotorrealismo frente a ilustración
Ejecuta y evalúa: busca las pistas típicas de la IA que se listan arriba. Si ves piel uniforme, vuelve a intentarlo con lenguaje de textura explícito
Ajustes y parámetros para probar
Algunas combinaciones que producen resultados sólidos con regularidad:
Retratos: lenguaje de 85 mm + luz de ventana + Kodak Portra 400 + poros/pecas visibles
Entornos: lente amplia + ubicación con nombre + clima/hora del día específicos + grano de película
Productos: toma macro cenital + superficie nombrada de mármol/madera + luz de estudio suave desde arriba
💡 El modelo responde bien a las descripciones negativas. Añadir "sin iluminación artificial, sin aspecto de posprocesado digital, sin composición de banco de imágenes" empuja los resultados hacia un realismo editorial.
Sujeto por sujeto
Retratos que engañan al ojo
Los retratos son la categoría más difícil. Los ojos humanos están calibrados por la evolución para detectar sutiles fallos en los rostros: es el problema del valle inquietante. Para superarlo con GPT Image 1.5, el enfoque consiste en añadir una imperfección creíble.
Los rostros reales tienen:
Tono de piel irregular: un poco más cálido en la nariz, más frío bajo los ojos
Asimetría: un ojo ligeramente más alto, una fosa nasal más ancha
Textura acorde al contexto: piel seca en invierno, un ligero brillo con el calor
Cabello con comportamiento propio: algunos mechones sobre la frente, un poco de encrespado en la coronilla
Incluye todo esto en tus prompts. El modelo lo maneja muy bien cuando se le indica. Sin ello, obtienes un rostro que parece retocado por alguien que nunca ha visto a una persona real.
Paisajes y arquitectura
En los paisajes, GPT Image 1.5 tiene su mayor ventaja natural. El modelo maneja la perspectiva atmosférica, la forma en que las colinas lejanas se desvanecen en la neblina, y la forma en que la niebla de la mañana se posa sobre el agua, con una precisión notable.
Las reglas aquí:
Indica siempre una hora del día y una estación: estas restringen específicamente el comportamiento de la luz
Añade el clima: los días nublados crean una luz uniforme y bonita; la lluvia crea superficies reflectantes
Especifica capas de distancia: primer plano cercano, sujeto en el plano medio, fondo lejano. Esto obliga a crear profundidad
Incluye textura a varias escalas: grava en un camino, óxido en una barandilla, musgo sobre piedra
Productos y naturaleza muerta
La fotografía de producto es engañosamente exigente. El reto: las fotos reales de producto tienen una imperfección controlada e intencionada: una huella en una botella, una ligera sombra que sugiere peso, una superficie que ha sido usada.
Para la naturaleza muerta con GPT Image 1.5:
Usa materiales de superficie con nombre (mármol de Carrara, madera de nogal, lino gris), no solo "fondo blanco"
Especifica el tipo de sombra: "sombras largas y suaves desde una única fuente arriba y ligeramente a la izquierda"
Añade elementos orgánicos a los productos inorgánicos (una ramita de hierba, un puñado de pétalos) para romper la sensación clínica
Usa lenguaje de lente macro con 50 mm o 100 mm para una textura de superficie extrema
Plantillas de prompt para copiar
La fórmula para retratos
[Subject with specific age, skin tone, hair type, natural imperfections] in [named location with specific time and season], wearing [specific fabric with texture description]. [Primary light: direction, quality, source]. [Secondary fill: brief description]. Caught in a [candid/contemplative/natural] moment. Shot on [camera body] with [lens] at [f-stop], ISO [number]. [Film stock] color grade, organic film grain, photorealistic, 8K. --ar 16:9 --style raw
La fórmula para entornos
[Aerial/low-angle/eye-level] view of [named location with cultural specificity] at [time of day] in [season/weather]. [Distance layer 1: specific texture]. [Distance layer 2: main subject]. [Distance layer 3: background quality and atmosphere]. [Light behavior at this time of day]. Shot at [focal length] f/[stop], [film stock] color grading, natural grain. --ar 16:9 --style raw
4 errores que matan el realismo
1. Usar adjetivos genéricos: "hermosa", "impresionante", "increíble" no le dicen nada al modelo sobre fotografía. Sustitúyelos por un lenguaje de observación específico.
2. Olvidarse del fondo: incluso cuando está desenfocado, el fondo tiene que ser físicamente creíble. "Fondo desenfocado" no es una ubicación. "Interior de un almacén desenfocado con lámparas colgantes de luz cálida" sí lo es.
3. Saltarse el grano de película: los renders de IA de acabado digital impecable se ven justo así: digitales e impecables. Las fotos reales, incluso las digitales modernas, tienen ruido, microcontraste y pequeñas variaciones en los canales de color. Especifica siempre un tipo de película o un equivalente de ruido digital.
4. Centrarlo todo: los fotógrafos reales usan la regla de los tercios de forma instintiva. Añade lenguaje de composición: "sujeto colocado en el tercio izquierdo del encuadre", "mirando hacia la mitad derecha vacía del encuadre". Esto rompe la tendencia por defecto de la IA a la simetría.
Tu turno: mira lo que hace
La diferencia entre una foto de IA que parece renderizada y una que parece tomada con una Sony A1 depende casi por completo de la precisión del prompt. GPT Image 1.5 tiene la capacidad. La cuestión es si tus prompts le dan la información que necesita.
PicassoIA te da acceso al modelo sin complicaciones de configuración. Toma la fórmula para retratos de arriba, cambia el sujeto por el tuyo y ejecútala. Compara el resultado con tus prompts anteriores. La diferencia en textura, comportamiento de la luz y realismo compositivo se verá de inmediato.
Además de GPT Image 1.5, PicassoIA también ofrece alternativas centradas en el fotorrealismo como Flux 1.1 Pro Ultra, Realistic Vision v5.1 y Qwen Image 2, cada una con sus propias fortalezas para distintas categorías de sujetos. La plataforma te permite cambiar entre ellos al instante y comparar los resultados lado a lado.
La fotografía de IA fotorrealista ya no depende de tener acceso al modelo adecuado. Depende de saber pedir lo que quieres.