Has dedicado tiempo a crear lo que parece un prompt sólido. Pulsas el botón de generar. Lo que sale está mal: la iluminación es plana, la composición es genérica y la atmósfera no tiene nada que ver con lo que imaginabas. Si esto te pasa con frecuencia, el problema casi seguro no es el modelo. Son las palabras.
Los generadores de imágenes con IA procesan el texto de forma distinta a como lo lee una persona. Asignan pesos a los tokens, extraen patrones de los datos de entrenamiento y resuelven la ambigüedad hacia promedios estadísticos. Ciertas palabras activan esa tendencia al promedio con mucha fuerza. Otras aportan tan poca información visual que el modelo rellena los huecos con lo que más ha visto, que rara vez es lo que tenías en mente. Esta es una guía directa de esas palabras y de lo que conviene poner en su lugar.
Por qué los prompts siguen dando resultados erróneos
El modelo procesa tokens, no intenciones
Cuando escribes "hazlo que se vea bonito", el modelo no te ignora. Simplemente no puede convertir "bonito" en una instrucción de píxeles. Esa palabra no tiene un equivalente visual coherente en los datos de entrenamiento. Podría significar un minimalismo pastel suave o una iluminación dramática de estudio. El modelo no puede saberlo.
Los modelos con mejor rendimiento de la plataforma, como Flux Dev y GPT Image 1, responden a un vocabulario visual concreto. No a adjetivos de opinión ni a comparaciones relativas, sino a descripciones físicas de lo que existe en la escena: fuente de luz, textura de superficie, distancia focal del objetivo, temperatura de color.

Por qué la especificidad es la única moneda válida
Compara "un coche al atardecer" con "un Ford Mustang fastback de 1967 en blanco Wimbledon, aparcado sobre asfalto mojado, ángulo trasero de tres cuartos, 24 mm, f/4, hora dorada, 10 minutos después de la puesta de sol, destello suave en el cromado del piloto trasero". El segundo prompt no cuesta nada más escribirlo. Los resultados son incomparablemente más intencionados.
La diferencia entre una generación mediocre y una excelente casi siempre es la especificidad. No un modelo mejor. No la suerte. Las palabras que eliges.
Palabras vagas de calidad que estropean el resultado
"Precioso", "increíble", "impresionante", "espectacular"
Probablemente son las palabras más comunes en los prompts débiles. Para una persona, "retrato precioso" tiene un peso emocional real. Para Flux Pro o Imagen 4 Ultra, esas palabras se resuelven en el promedio estadístico de todas las imágenes etiquetadas como bonitas en el conjunto de entrenamiento, es decir, un resultado sobreprocesado y genérico.
Describe por qué sería bonito para el objetivo de una cámara:
| En lugar de... | Escribe... |
|---|
| Atardecer precioso | 15 minutos después de la puesta de sol, luz ámbar y rosa a 6°, rayos volumétricos a través de capas de cirros |
| Retrato espectacular | 85 mm f/1.4, reflejos de luz en ambas pupilas, contraluz de pelo desde arriba, textura natural de la piel |
| Textura increíble | Macro de 60 mm, f/5.6, superficie de hormigón rugosa, depósitos minerales oxidados, red visible de grietas |

💡 Regla general: Si una palabra describe cómo te hace sentir algo en lugar de cómo se ve, elimínala del prompt y sustitúyela por una observación visual.
"Perfecto", "impecable", "ideal"
Los superlativos de opinión no aportan ningún dato visual. "Una composición perfecta" no se puede interpretar. El modelo no tiene juicio estético. Solo sabe lo que ha visto con más frecuencia en contextos parecidos, y eso es lo que devolverá con "perfecto": la mediana.
Elimina todos los superlativos. No añaden información y empujan al modelo hacia el comportamiento de promediar. Sustitúyelos por descripciones positivas concretas: "enfoque nítido en todo el sujeto, caída natural de la profundidad de campo, elemento del primer plano ligeramente suave".
Palabras relacionales que el modelo no puede procesar
"Más", "menos", "mejor", "peor"
Estas palabras solo funcionan en contexto. "Iluminación más dramática" ¿comparada con qué? Cada generación empieza desde cero. El modelo no tiene acceso a ningún resultado anterior cuando interpreta tu prompt actual. El lenguaje relacional no tiene sentido estructural en este contexto.
Reemplazos absolutos:
- "Más dramático" se convierte en "un único foco duro a 45° desde la izquierda, sombra que cubre el 65 % del sujeto"
- "Fondo menos cargado" se convierte en "fondo blanco liso y continuo, sin objetos ni textura"
- "Mejor piel" se convierte en "piel natural y suave, textura visible de poros, dispersión subsuperficial en las luces, sin imperfecciones"
"Hazlo más realista"
Esta instrucción confunde incluso a modelos capaces. Stable Diffusion 3 y Stable Diffusion 3.5 Large interpretan "realista" en un abanico enorme de significados posibles. El realismo fotográfico, la precisión anatómica, la iluminación físicamente plausible y la fidelidad de los materiales son ejes distintos.
Especifica qué eje importa:
- Fotográfico: "35 mm f/2.8, Kodak Portra 400, luz disponible, grano de película visible en las sombras"
- Anatómico: "proporciones correctas de la mano, articulaciones naturales de los dedos, sombras naturales en los pliegues de los nudillos"
- Material: "tela de algodón con estructura de hilo visible, brillo sutil en las luces, arrugas naturales de caída"
Errores de tamaño, escala y cantidad
"Grande", "pequeño", "alto", "bajo"
Son términos relativos sin un objeto de referencia. "Una multitud grande" puede generarse como 20 personas o como 2000. Sin un ancla física en la escena, el modelo recurre a lo que produjo el promedio del entrenamiento para esa frase. La escala se vuelve irregular.

Añade una referencia:
- "Una multitud grande" se convierte en "cientos de personas llenando una plaza de la ciudad, tomada desde 30 metros de altura, rostros individuales visibles en los márgenes"
- "Una habitación pequeña" se convierte en "interior de un espacio de 3x4 metros, techo bajo, muebles ocupando la mayor parte del suelo, paredes cerca de la cámara"
- "Un edificio alto" se convierte en "torre de cristal de 40 plantas, tomada desde la calle mirando hacia arriba, gran angular de 16 mm, líneas verticales convergentes"
"Unos pocos", "algunos", "muchos", "varios"
El lenguaje de cantidad produce resultados muy irregulares entre generaciones. "Unas pocas flores" puede aparecer como tres o como cuarenta, según lo que el modelo extraiga de los datos de entrenamiento para esa frase. Si el número afecta a tu composición, sé explícito. "Tres girasoles" siempre dará mejores resultados que "algunos girasoles".
💡 Cuando el número exacto no importa, usa lenguaje de densidad: "flores apiñadas en el primer plano" o "flores escasas y aisladas con espacio visible entre cada tallo". La densidad es una propiedad visual. El conteo, no.
Etiquetas de estilo que significan muy poco
"Cinematográfico"
"Cinematográfico" es la palabra más sobreutilizada en la escritura de prompts de IA y se ha entrenado hasta quedarse casi sin significado. Los modelos ahora la interpretan por defecto como "oscuro, ligeramente desaturado, neblina atmosférica, destello de lente vago". Eso cubre cerca de un 5 % del cine real.
Sustitúyela por lo que realmente quieres decir:
- Anamórfico: "bokeh ovalado de lente anamórfica, destellos horizontales de lente, encuadre letterbox 2.39:1, gradación azul verdosa y naranja"
- Documental: "cámara en mano, ligera vibración de cámara, solo luz disponible, 24 mm, profundidad de campo amplia, color natural"
- Drama de estudio: "iluminación de tres puntos, sombras controladas, fondo liso gris medio, 50 mm f/5.6"
"Estético", "vibrante", "vívido"
"Estético" es una etiqueta casi inútil después de años de dilución en redes sociales. Toda imagen tiene una estética. Nombrarla no aporta nada. Describe las propiedades visuales que definen el look que quieres.
"Vibrante" y "vívido" suelen empujar a los modelos hacia una saturación excesiva. Las imágenes salen como si hubieran pasado por un filtro de Instagram al máximo.
| Evitar | Usar en su lugar |
|---|
| Colores vibrantes | Tonos primarios saturados, simulación de Fuji Velvia, detalle rico en las sombras |
| Cielo vívido | Cielo azul cobalto profundo, efecto de filtro polarizador, bordes de nube nítidos |
| Estético | Describe propiedades concretas: verdes apagados, texturas de algodón, neblina de la tarde |

Referencias temporales que confunden
"Moderno", "clásico", "retro", "vintage"
Estas etiquetas temporales abarcan décadas de estilos visuales completamente distintos. "Una cocina moderna" puede ser de los años 1970 en tono oro cosecha o un minimalismo de 2024 con herrajes integrados. Los modelos las resuelven en compuestos promediados de todos los datos de entrenamiento de esa etiqueta de época, sin producir un periodo concreto.
Indica la década o el movimiento de diseño:
- "Moderno" se convierte en "minimalismo escandinavo de los años 2020: armarios lacados en blanco mate, tiradores integrados, encimeras de cuarzo, suelo de roble"
- "Vintage" se convierte en "cocina americana de los años 1970: electrodomésticos en tono oro cosecha, chapa de nogal oscuro, salpicadero de azulejo color aguacate"
- "Retro" se convierte en "restaurante americano de los años 1950: taburetes cromados, asientos de vinilo rojo, azulejo en blanco y negro a cuadros"
"Profesional"
"Retrato profesional" es uno de los prompts malos más frecuentes que se envían a los generadores de IA. Los modelos devuelven un resultado promediado de foto de archivo, con iluminación de estudio plana y una expresión rígida. Desglósalo en sus componentes reales.
Qué significa "profesional" en términos visuales:
- Iluminación: softbox a 45° a la izquierda de la cámara, relleno con reflector plateado a la derecha de la cámara, luz de pelo desde arriba
- Fondo: gris medio neutro y liso con un ligero viñeteado en las esquinas
- Expresión: mirada directa y neutra, ligera tensión en la mandíbula, posición natural de los labios en reposo
- Técnica: 85 mm f/5.6, nítido en todo el rostro, orejas ligeramente suaves, sin desenfoque por movimiento
Instrucciones negativas y trampas de estructura
Negativos en el campo de prompt principal
Instrucciones como "sin fondo", "sin personas" y "no demasiado oscuro" no funcionan en el prompt positivo. Los modelos de imagen con IA no son motores de lógica. Cuando escribes "sin fondo", introduces el concepto de "fondo" en el flujo de tokens, lo que puede reforzar paradójicamente los elementos de fondo en el resultado.

Modelos como Ideogram v3 Turbo y SDXL Lightning 4Step tienen campos de prompt negativo específicos precisamente por esta razón. Úsalos.
La reformulación positiva:
- "Sin fondo" en positivo se convierte en "aislado sobre fondo blanco liso", y "fondo, entorno, escenario" va en el prompt negativo
- "No muy oscuro" se convierte en "iluminación de alta clave, luminosa, aireada, sombras ligeramente sobreexpuestas"
- "Sin texto" funciona mejor como entrada del prompt negativo: "texto, marca de agua, etiqueta, palabras"
Estructura de frase frente a descripción visual
Las frases completas tienen una estructura gramatical que los modelos de IA descartan en parte a favor de los tokens de sustantivos y adjetivos. "Una mujer que está de pie junto a una ventana con la luz de la mañana" es menos eficaz que "mujer de pie, ventana alta, luz de la mañana, silueta suave a contraluz".
Las palabras de enlace como "que", "quien", "cual" y "mientras" añaden ruido al procesamiento sin aportar señal visual.
Comparación de formatos:
| Estilo de frase | Estilo de tokens visuales |
|---|
| Una mujer que parece feliz junto a una ventana | woman, warm smile, tall window, soft afternoon light |
| Una calle que parece antigua y con buena iluminación | cobblestone street, 19th century European, golden hour, long shadows |
| Un coche que parece rápido y potente | low-angle red Ferrari F40, motion blur on rear wheels, f/4 depth of field |
Así son los prompts sólidos en la práctica
Los cuatro pilares de un prompt fiable
Todo prompt eficaz cubre cuatro categorías. Si falta alguna, el modelo rellena ese hueco con su propio promedio. Revisa cada prompt con esta lista antes de generar:
- Sujeto: descripción física y concreta del foco principal, con posición, expresión, ropa, edad y detalles distintivos
- Entorno: el espacio que ocupa el sujeto, descrito con materiales, distancias y referencias de escala concretas
- Iluminación: dirección, calidad (dura o suave), temperatura de color y la fuente de luz física
- Especificaciones técnicas: distancia focal del objetivo, apertura, tipo de película, relación de aspecto y cualquier referencia de época o de fotógrafo

💡 Pasa cada prompt por esta lista antes de generar. Detectarás el 80 % de tu lenguaje vago antes de que te cueste un crédito de generación.
Cambios de vocabulario fotográfico
La mejora más rápida que puedes hacer es sustituir los adjetivos abstractos por vocabulario fotográfico. Los modelos entrenados con enormes conjuntos de imágenes responden muy bien al lenguaje técnico de cámara e iluminación. Estos términos tienen referentes visuales concretos y coherentes en los datos de entrenamiento.
Tabla de cambios rápidos:
| Palabra abstracta | Término fotográfico |
|---|
| Onírico | Enfoque suave, f/1.4, ligera sobreexposición, destello de lente en las luces |
| Dramático | Única fuente de luz dura, alto contraste, relación de sombras profundas |
| Limpio | Fondo blanco liso y continuo, softbox grande justo desde arriba, sin textura |
| Melancólico | Solo luz disponible, dominante de color de tungsteno, grano de 35 mm en los medios tonos |
| Nítido | 85 mm f/8, apilado de enfoque, luz dura de mediodía, cero movimiento de cámara |
| Cálido | Paleta de Kodak Portra 400, desplazamiento a 5500 K de tungsteno, ámbar en las sombras |
Pon los principios en práctica ahora
Toma tus últimos tres prompts fallidos y reescríbelos aplicando todos los principios anteriores. Elimina cada palabra de opinión. Sustituye cada comparación relacional por valores absolutos. Añade una especificación de objetivo de cámara. Nombra el montaje de iluminación. Reemplaza todas las etiquetas temporales por descripciones de década concreta. Añade una referencia de tipo de película.
Después, genera la misma escena en paralelo con Flux Dev o Stable Diffusion 3.5 Large en PicassoIA. La diferencia en la calidad del resultado cambiará para siempre tu forma de trabajar con los prompts.

Más de 91 modelos de texto a imagen esperan a responder a un prompt bien escrito en PicassoIA. Ideogram v3 Turbo destaca con prompts que incluyen elementos de texto. GPT Image 1 maneja muy bien las escenas complejas con varios elementos. SDXL Lightning 4Step es ideal para iterar rápido al probar revisiones de prompts. Flux Schnell LoRA responde a direcciones estilísticas concretas con resultados rápidos y limpios.
Elige uno. Escribe un prompt preciso con todo lo que has leído aquí. Mira lo que produce un lenguaje específico y deliberado. Y eso es todo lo que hay que hacer.
