Evita estas palabras en los prompts de IA (y qué escribir en su lugar)

La mayoría de la gente escribe los prompts de IA como si escribiera una búsqueda en Google. Por eso sus resultados salen genéricos y alejados de lo que buscan. Este artículo desglosa las palabras y frases concretas que debilitan tus prompts, explica por qué los modelos de IA las malinterpretan y te da los reemplazos exactos que producen imágenes más precisas e intencionadas en cada generación.

Evita estas palabras en los prompts de IA (y qué escribir en su lugar)
Cristian Da Conceicao
Fundador de Picasso IA

Has dedicado tiempo a crear lo que parece un prompt sólido. Pulsas el botón de generar. Lo que sale está mal: la iluminación es plana, la composición es genérica y la atmósfera no tiene nada que ver con lo que imaginabas. Si esto te pasa con frecuencia, el problema casi seguro no es el modelo. Son las palabras.

Los generadores de imágenes con IA procesan el texto de forma distinta a como lo lee una persona. Asignan pesos a los tokens, extraen patrones de los datos de entrenamiento y resuelven la ambigüedad hacia promedios estadísticos. Ciertas palabras activan esa tendencia al promedio con mucha fuerza. Otras aportan tan poca información visual que el modelo rellena los huecos con lo que más ha visto, que rara vez es lo que tenías en mente. Esta es una guía directa de esas palabras y de lo que conviene poner en su lugar.

Por qué los prompts siguen dando resultados erróneos

El modelo procesa tokens, no intenciones

Cuando escribes "hazlo que se vea bonito", el modelo no te ignora. Simplemente no puede convertir "bonito" en una instrucción de píxeles. Esa palabra no tiene un equivalente visual coherente en los datos de entrenamiento. Podría significar un minimalismo pastel suave o una iluminación dramática de estudio. El modelo no puede saberlo.

Los modelos con mejor rendimiento de la plataforma, como Flux Dev y GPT Image 1, responden a un vocabulario visual concreto. No a adjetivos de opinión ni a comparaciones relativas, sino a descripciones físicas de lo que existe en la escena: fuente de luz, textura de superficie, distancia focal del objetivo, temperatura de color.

Persona con el resplandor de la pantalla de un equipo portátil iluminando el rostro con poca luz

Por qué la especificidad es la única moneda válida

Compara "un coche al atardecer" con "un Ford Mustang fastback de 1967 en blanco Wimbledon, aparcado sobre asfalto mojado, ángulo trasero de tres cuartos, 24 mm, f/4, hora dorada, 10 minutos después de la puesta de sol, destello suave en el cromado del piloto trasero". El segundo prompt no cuesta nada más escribirlo. Los resultados son incomparablemente más intencionados.

La diferencia entre una generación mediocre y una excelente casi siempre es la especificidad. No un modelo mejor. No la suerte. Las palabras que eliges.

Palabras vagas de calidad que estropean el resultado

"Precioso", "increíble", "impresionante", "espectacular"

Probablemente son las palabras más comunes en los prompts débiles. Para una persona, "retrato precioso" tiene un peso emocional real. Para Flux Pro o Imagen 4 Ultra, esas palabras se resuelven en el promedio estadístico de todas las imágenes etiquetadas como bonitas en el conjunto de entrenamiento, es decir, un resultado sobreprocesado y genérico.

Describe por qué sería bonito para el objetivo de una cámara:

En lugar de...Escribe...
Atardecer precioso15 minutos después de la puesta de sol, luz ámbar y rosa a 6°, rayos volumétricos a través de capas de cirros
Retrato espectacular85 mm f/1.4, reflejos de luz en ambas pupilas, contraluz de pelo desde arriba, textura natural de la piel
Textura increíbleMacro de 60 mm, f/5.6, superficie de hormigón rugosa, depósitos minerales oxidados, red visible de grietas

Palabras tachadas en una libreta de notas con correcciones en rojo

💡 Regla general: Si una palabra describe cómo te hace sentir algo en lugar de cómo se ve, elimínala del prompt y sustitúyela por una observación visual.

"Perfecto", "impecable", "ideal"

Los superlativos de opinión no aportan ningún dato visual. "Una composición perfecta" no se puede interpretar. El modelo no tiene juicio estético. Solo sabe lo que ha visto con más frecuencia en contextos parecidos, y eso es lo que devolverá con "perfecto": la mediana.

Elimina todos los superlativos. No añaden información y empujan al modelo hacia el comportamiento de promediar. Sustitúyelos por descripciones positivas concretas: "enfoque nítido en todo el sujeto, caída natural de la profundidad de campo, elemento del primer plano ligeramente suave".

Palabras relacionales que el modelo no puede procesar

"Más", "menos", "mejor", "peor"

Estas palabras solo funcionan en contexto. "Iluminación más dramática" ¿comparada con qué? Cada generación empieza desde cero. El modelo no tiene acceso a ningún resultado anterior cuando interpreta tu prompt actual. El lenguaje relacional no tiene sentido estructural en este contexto.

Reemplazos absolutos:

  • "Más dramático" se convierte en "un único foco duro a 45° desde la izquierda, sombra que cubre el 65 % del sujeto"
  • "Fondo menos cargado" se convierte en "fondo blanco liso y continuo, sin objetos ni textura"
  • "Mejor piel" se convierte en "piel natural y suave, textura visible de poros, dispersión subsuperficial en las luces, sin imperfecciones"

"Hazlo más realista"

Esta instrucción confunde incluso a modelos capaces. Stable Diffusion 3 y Stable Diffusion 3.5 Large interpretan "realista" en un abanico enorme de significados posibles. El realismo fotográfico, la precisión anatómica, la iluminación físicamente plausible y la fidelidad de los materiales son ejes distintos.

Especifica qué eje importa:

  • Fotográfico: "35 mm f/2.8, Kodak Portra 400, luz disponible, grano de película visible en las sombras"
  • Anatómico: "proporciones correctas de la mano, articulaciones naturales de los dedos, sombras naturales en los pliegues de los nudillos"
  • Material: "tela de algodón con estructura de hilo visible, brillo sutil en las luces, arrugas naturales de caída"

Errores de tamaño, escala y cantidad

"Grande", "pequeño", "alto", "bajo"

Son términos relativos sin un objeto de referencia. "Una multitud grande" puede generarse como 20 personas o como 2000. Sin un ancla física en la escena, el modelo recurre a lo que produjo el promedio del entrenamiento para esa frase. La escala se vuelve irregular.

Mesa de trabajo vista desde arriba con notas adhesivas, rotulador Sharpie y notas escritas a mano

Añade una referencia:

  • "Una multitud grande" se convierte en "cientos de personas llenando una plaza de la ciudad, tomada desde 30 metros de altura, rostros individuales visibles en los márgenes"
  • "Una habitación pequeña" se convierte en "interior de un espacio de 3x4 metros, techo bajo, muebles ocupando la mayor parte del suelo, paredes cerca de la cámara"
  • "Un edificio alto" se convierte en "torre de cristal de 40 plantas, tomada desde la calle mirando hacia arriba, gran angular de 16 mm, líneas verticales convergentes"

"Unos pocos", "algunos", "muchos", "varios"

El lenguaje de cantidad produce resultados muy irregulares entre generaciones. "Unas pocas flores" puede aparecer como tres o como cuarenta, según lo que el modelo extraiga de los datos de entrenamiento para esa frase. Si el número afecta a tu composición, sé explícito. "Tres girasoles" siempre dará mejores resultados que "algunos girasoles".

💡 Cuando el número exacto no importa, usa lenguaje de densidad: "flores apiñadas en el primer plano" o "flores escasas y aisladas con espacio visible entre cada tallo". La densidad es una propiedad visual. El conteo, no.

Etiquetas de estilo que significan muy poco

"Cinematográfico"

"Cinematográfico" es la palabra más sobreutilizada en la escritura de prompts de IA y se ha entrenado hasta quedarse casi sin significado. Los modelos ahora la interpretan por defecto como "oscuro, ligeramente desaturado, neblina atmosférica, destello de lente vago". Eso cubre cerca de un 5 % del cine real.

Sustitúyela por lo que realmente quieres decir:

  • Anamórfico: "bokeh ovalado de lente anamórfica, destellos horizontales de lente, encuadre letterbox 2.39:1, gradación azul verdosa y naranja"
  • Documental: "cámara en mano, ligera vibración de cámara, solo luz disponible, 24 mm, profundidad de campo amplia, color natural"
  • Drama de estudio: "iluminación de tres puntos, sombras controladas, fondo liso gris medio, 50 mm f/5.6"

"Estético", "vibrante", "vívido"

"Estético" es una etiqueta casi inútil después de años de dilución en redes sociales. Toda imagen tiene una estética. Nombrarla no aporta nada. Describe las propiedades visuales que definen el look que quieres.

"Vibrante" y "vívido" suelen empujar a los modelos hacia una saturación excesiva. Las imágenes salen como si hubieran pasado por un filtro de Instagram al máximo.

EvitarUsar en su lugar
Colores vibrantesTonos primarios saturados, simulación de Fuji Velvia, detalle rico en las sombras
Cielo vívidoCielo azul cobalto profundo, efecto de filtro polarizador, bordes de nube nítidos
EstéticoDescribe propiedades concretas: verdes apagados, texturas de algodón, neblina de la tarde

Mujer concentrada en un escritorio minimalista con luz de la ventana por la mañana

Referencias temporales que confunden

"Moderno", "clásico", "retro", "vintage"

Estas etiquetas temporales abarcan décadas de estilos visuales completamente distintos. "Una cocina moderna" puede ser de los años 1970 en tono oro cosecha o un minimalismo de 2024 con herrajes integrados. Los modelos las resuelven en compuestos promediados de todos los datos de entrenamiento de esa etiqueta de época, sin producir un periodo concreto.

Indica la década o el movimiento de diseño:

  • "Moderno" se convierte en "minimalismo escandinavo de los años 2020: armarios lacados en blanco mate, tiradores integrados, encimeras de cuarzo, suelo de roble"
  • "Vintage" se convierte en "cocina americana de los años 1970: electrodomésticos en tono oro cosecha, chapa de nogal oscuro, salpicadero de azulejo color aguacate"
  • "Retro" se convierte en "restaurante americano de los años 1950: taburetes cromados, asientos de vinilo rojo, azulejo en blanco y negro a cuadros"

"Profesional"

"Retrato profesional" es uno de los prompts malos más frecuentes que se envían a los generadores de IA. Los modelos devuelven un resultado promediado de foto de archivo, con iluminación de estudio plana y una expresión rígida. Desglósalo en sus componentes reales.

Qué significa "profesional" en términos visuales:

  • Iluminación: softbox a 45° a la izquierda de la cámara, relleno con reflector plateado a la derecha de la cámara, luz de pelo desde arriba
  • Fondo: gris medio neutro y liso con un ligero viñeteado en las esquinas
  • Expresión: mirada directa y neutra, ligera tensión en la mandíbula, posición natural de los labios en reposo
  • Técnica: 85 mm f/5.6, nítido en todo el rostro, orejas ligeramente suaves, sin desenfoque por movimiento

Instrucciones negativas y trampas de estructura

Negativos en el campo de prompt principal

Instrucciones como "sin fondo", "sin personas" y "no demasiado oscuro" no funcionan en el prompt positivo. Los modelos de imagen con IA no son motores de lógica. Cuando escribes "sin fondo", introduces el concepto de "fondo" en el flujo de tokens, lo que puede reforzar paradójicamente los elementos de fondo en el resultado.

Hombre con barba de varios días en un retrato pensativo tomado desde un ángulo bajo

Modelos como Ideogram v3 Turbo y SDXL Lightning 4Step tienen campos de prompt negativo específicos precisamente por esta razón. Úsalos.

La reformulación positiva:

  • "Sin fondo" en positivo se convierte en "aislado sobre fondo blanco liso", y "fondo, entorno, escenario" va en el prompt negativo
  • "No muy oscuro" se convierte en "iluminación de alta clave, luminosa, aireada, sombras ligeramente sobreexpuestas"
  • "Sin texto" funciona mejor como entrada del prompt negativo: "texto, marca de agua, etiqueta, palabras"

Estructura de frase frente a descripción visual

Las frases completas tienen una estructura gramatical que los modelos de IA descartan en parte a favor de los tokens de sustantivos y adjetivos. "Una mujer que está de pie junto a una ventana con la luz de la mañana" es menos eficaz que "mujer de pie, ventana alta, luz de la mañana, silueta suave a contraluz".

Las palabras de enlace como "que", "quien", "cual" y "mientras" añaden ruido al procesamiento sin aportar señal visual.

Comparación de formatos:

Estilo de fraseEstilo de tokens visuales
Una mujer que parece feliz junto a una ventanawoman, warm smile, tall window, soft afternoon light
Una calle que parece antigua y con buena iluminacióncobblestone street, 19th century European, golden hour, long shadows
Un coche que parece rápido y potentelow-angle red Ferrari F40, motion blur on rear wheels, f/4 depth of field

Así son los prompts sólidos en la práctica

Los cuatro pilares de un prompt fiable

Todo prompt eficaz cubre cuatro categorías. Si falta alguna, el modelo rellena ese hueco con su propio promedio. Revisa cada prompt con esta lista antes de generar:

  1. Sujeto: descripción física y concreta del foco principal, con posición, expresión, ropa, edad y detalles distintivos
  2. Entorno: el espacio que ocupa el sujeto, descrito con materiales, distancias y referencias de escala concretas
  3. Iluminación: dirección, calidad (dura o suave), temperatura de color y la fuente de luz física
  4. Especificaciones técnicas: distancia focal del objetivo, apertura, tipo de película, relación de aspecto y cualquier referencia de época o de fotógrafo

Dos profesionales revisando páginas impresas en un estudio con luz de hora dorada

💡 Pasa cada prompt por esta lista antes de generar. Detectarás el 80 % de tu lenguaje vago antes de que te cueste un crédito de generación.

Cambios de vocabulario fotográfico

La mejora más rápida que puedes hacer es sustituir los adjetivos abstractos por vocabulario fotográfico. Los modelos entrenados con enormes conjuntos de imágenes responden muy bien al lenguaje técnico de cámara e iluminación. Estos términos tienen referentes visuales concretos y coherentes en los datos de entrenamiento.

Tabla de cambios rápidos:

Palabra abstractaTérmino fotográfico
OníricoEnfoque suave, f/1.4, ligera sobreexposición, destello de lente en las luces
DramáticoÚnica fuente de luz dura, alto contraste, relación de sombras profundas
LimpioFondo blanco liso y continuo, softbox grande justo desde arriba, sin textura
MelancólicoSolo luz disponible, dominante de color de tungsteno, grano de 35 mm en los medios tonos
Nítido85 mm f/8, apilado de enfoque, luz dura de mediodía, cero movimiento de cámara
CálidoPaleta de Kodak Portra 400, desplazamiento a 5500 K de tungsteno, ámbar en las sombras

Pon los principios en práctica ahora

Toma tus últimos tres prompts fallidos y reescríbelos aplicando todos los principios anteriores. Elimina cada palabra de opinión. Sustituye cada comparación relacional por valores absolutos. Añade una especificación de objetivo de cámara. Nombra el montaje de iluminación. Reemplaza todas las etiquetas temporales por descripciones de década concreta. Añade una referencia de tipo de película.

Después, genera la misma escena en paralelo con Flux Dev o Stable Diffusion 3.5 Large en PicassoIA. La diferencia en la calidad del resultado cambiará para siempre tu forma de trabajar con los prompts.

Manos escribiendo en un smartphone en una cafetería cálida con luz bokeh

Más de 91 modelos de texto a imagen esperan a responder a un prompt bien escrito en PicassoIA. Ideogram v3 Turbo destaca con prompts que incluyen elementos de texto. GPT Image 1 maneja muy bien las escenas complejas con varios elementos. SDXL Lightning 4Step es ideal para iterar rápido al probar revisiones de prompts. Flux Schnell LoRA responde a direcciones estilísticas concretas con resultados rápidos y limpios.

Elige uno. Escribe un prompt preciso con todo lo que has leído aquí. Mira lo que produce un lenguaje específico y deliberado. Y eso es todo lo que hay que hacer.

Vista aérea de una página de diario escrita a mano con asociaciones de palabras hechas con pluma estilográfica

Compartir este artículo

Elige tu idioma