Cuando escribes un prompt en Sora 2, ocurre algo mucho más complejo que una búsqueda por palabras clave. El modelo no busca "playa al atardecer" y une imágenes que coincidan. Construye una escena completamente nueva desde cero, infiriendo la física, las relaciones espaciales, el comportamiento de la luz y el movimiento de los objetos a partir del lenguaje concreto que has elegido. Esa distancia entre lo que la mayoría escribe y lo que Sora 2 puede producir realmente es precisamente lo que aborda este artículo.
Qué hace realmente Sora 2 con tus palabras

Sora 2 es un modelo de transformador de difusión entrenado con un enorme corpus de pares de video y texto. Cuando llega tu prompt, el modelo no procesa las palabras una a una como un modelo de lenguaje básico. Codifica la frase completa como un conjunto de relaciones semánticas e intenciones espaciales, y luego usa esas relaciones para condicionar el proceso de generación desde el primer fotograma.
El modelo ha aprendido a reconocer no solo sustantivos y verbos, sino también el significado composicional: la diferencia entre "un perro persiguiendo una pelota" y "una pelota perseguida por un perro" no es trivial para un modelo de video. Sora 2 conserva esa direccionalidad. El sujeto, el objeto y la dirección del movimiento influyen de forma independiente en el resultado.
De texto a modelo del mundo
Lo que diferencia a Sora 2 de los sistemas anteriores de texto a video es su representación interna del mundo. En lugar de tratar el video como una secuencia de imágenes independientes, mantiene un modelo espacial tridimensional coherente durante toda la duración del clip.
Cuando escribes "una mujer camina desde la cocina hasta la sala de estar", el modelo infiere:
- Las dos habitaciones son espacialmente contiguas y están conectadas por una puerta
- El cuerpo de la mujer ocupa un espacio continuo mientras atraviesa la transición
- Las condiciones de iluminación pueden cambiar entre zonas debido a la posición distinta de las ventanas
- La perspectiva de la cámara debe mantenerse coherente para preservar la coherencia espacial
Por eso un prompt como "la cámara orbita lentamente alrededor de un deportivo rojo aparcado en una carretera vacía al atardecer" produce resultados que parecen físicamente sólidos. El coche sigue siendo el mismo desde cada ángulo. La carretera se mantiene nivelada. La fuente de luz permanece coherente en todos los fotogramas de la órbita.
El papel de la simulación física

Sora 2 tiene una comprensión implícita de cómo se comportan los objetos en el mundo físico. La tela se mueve con el viento. El agua refleja y forma ondas. El cabello capta la luz de forma distinta a la tela. El fuego sube. Estas no son reglas programadas. Surgen de los patrones de los datos de entrenamiento, pero son sorprendentemente fiables cuando tu prompt activa el comportamiento adecuado.
💡 Tip: Describe los materiales de forma explícita. "Un vestido de seda que atrapa la brisa del océano" producirá una física de la tela mejor que solo "una mujer en la playa". El tipo de material activa el comportamiento físico aprendido durante el proceso de generación.
El modelo también respeta las relaciones de escala. Una "vista de cerca de una hormiga cargando un grano de arena" indica al modelo que reduzca el encuadre y exagere las texturas superficiales. Una "vista satelital de una ciudad de noche" lleva la cámara virtual a una altitud en la que las personas dejan de ser visibles y solo quedan la trama de las calles y los conjuntos de luces. La escala es una instrucción semántica, no solo un ajuste de zoom.
Cómo cambia todo la precisión
La mayoría escribe prompts como si mandara un mensaje a un amigo: cortos, informales y llenos de contexto implícito. Eso funciona bien para peticiones generales. Pero Sora 2 premia la precisión de una forma directa y medible. Cada palabra vaga es una oportunidad que el modelo llena con un valor predeterminado arbitrario.
Prompts vagos frente a prompts precisos
Esta es una comparación concreta de lo que ocurre con distintos niveles de precisión en el prompt:
| Tipo de prompt | Ejemplo | Resultado típico |
|---|
| Vago | "Una mujer caminando" | Figura genérica, entorno indefinido, iluminación plana |
| Medio | "Una mujer caminando por un parque por la tarde" | Más definido, pero Sora 2 rellena muchos huecos de forma arbitraria |
| Preciso | "Una mujer de unos 30 años con el pelo rizado y oscuro camina por un sendero cubierto de hojas en un parque tranquilo de otoño, luz moteada que se filtra entre árboles dorados, plano desde atrás a media distancia, sensación de objetivo de 50 mm" | Alta fidelidad, atmósfera coherente, identidad visual constante |
El prompt preciso no es más difícil de escribir. Solo exige pensar en más dimensiones a la vez: quién, dónde, cuándo, cómo se ve y cómo lo vemos. Esas cinco dimensiones cubren la mayor parte de lo que separa un resultado atractivo de uno olvidable.
Los elementos de la escena que más importan

No todos los detalles descriptivos pesan lo mismo. Estos elementos tienen el mayor impacto en la calidad del resultado, más o menos por orden de influencia:
- Identidad y acción del sujeto: el principal impulsor del contenido de la escena
- Entorno y escenario: establece el contexto espacial y situacional
- Calidad y dirección de la luz: la señal visible más clara de calidad
- Posición y movimiento de la cámara: determina la composición y la perspectiva del espectador
- Contexto temporal: la hora del día, el clima o la estación lo afectan todo
- Material y textura: activan el comportamiento de la simulación física
Los adjetivos emocionales como "melancólico" o "alegre" sí afectan ligeramente a la corrección de color y al ritmo, pero siguen siendo secundarios frente a los seis elementos estructurales anteriores. Construye primero esos seis y luego añade el tono emocional.
El lenguaje de cámara al que responde Sora 2

Una de las capacidades menos aprovechadas de Sora 2 es su dominio del vocabulario cinematográfico. El modelo se ha entrenado con imágenes de cine y televisión profesionales, donde la terminología de cámara está estrechamente relacionada con resultados visuales concretos. Usar ese vocabulario no es un truco. Es hablar la lengua nativa del modelo.
Tipos de plano y ángulos
Usar terminología precisa de plano desplaza siempre el resultado hacia el encuadre que buscas:
- "Primerísimo primer plano" acerca a los rasgos del rostro o a las superficies de un objeto
- "Contrapicado" crea dramatismo al colocar la cámara por debajo del sujeto mirando hacia arriba
- "Vista cenital" o "plano aéreo" sitúa la cámara directamente por encima
- "Ángulo holandés" inclina el encuadre para generar tensión psicológica o desorientación
- "Plano por encima del hombro" sitúa al espectador detrás de un personaje que mira a otro
- "Plano de dos" encuadra a dos personajes juntos en la misma composición
El modelo no siempre ejecuta estos términos a la perfección, pero incluir la terminología desplaza la distribución de probabilidades de forma notable hacia el encuadre buscado. Es mejor pedirlo y acercarse al resultado que no pedirlo.
Indicaciones de movimiento y ritmo
Sora 2 entiende las descripciones de movimiento tanto a nivel del sujeto como a nivel de la cámara, de forma independiente:
- "La cámara se acerca lentamente a su rostro" describe solo el movimiento de la cámara
- "Ella camina deprisa y luego se detiene de golpe" describe solo el movimiento del sujeto
- "Un paneo suave de izquierda a derecha sobre el perfil de la ciudad" especifica la dirección y la velocidad de la cámara
| Movimiento de cámara deseado | Frase que funciona |
|---|
| Zoom lento hacia dentro | "la cámara se acerca poco a poco" |
| Órbita alrededor de un objeto | "la cámara orbita 180 grados alrededor del sujeto" |
| Plano de seguimiento | "la cámara sigue al sujeto por detrás a ritmo de paseo" |
| Estático, bloqueado | "plano fijo sobre trípode, sin ningún movimiento de cámara" |
| Sensación de cámara en mano | "ligeramente inestable, estilo documental con cámara en mano" |
| Grúa o elevación | "la cámara sube despacio desde el nivel del suelo hasta la altura de una azotea" |
💡 Tip: Indica siempre si la cámara se mueve o permanece quieta. Si lo omites, Sora 2 puede introducir una deriva sutil o un zoom lento que no pretendías. El silencio sobre el movimiento de cámara no se interpreta como "ningún movimiento".
Iluminación, atmósfera y hora del día

La iluminación es la variable atmosférica más poderosa que tienes en un prompt. Afecta al ambiente, a la calidad aparente de la producción y al realismo físico de cada superficie de la escena. Sora 2 procesa las indicaciones de luz con una precisión notable cuando se expresan de forma explícita en lugar de dejarlas a la inferencia.
Dirección y calidad de la luz
Estos descriptores de iluminación tienen el efecto más fuerte en el resultado:
- "Hora dorada" produce una luz solar ámbar y cálida, en ángulo bajo, con sombras largas y suaves
- "Luz difusa de cielo cubierto" produce una iluminación suave y uniforme, sin sombras, en todas las superficies
- "Lámpara práctica única" coloca una fuente de luz visible dentro del encuadre con una caída realista
- "Contraluz frente a una ventana" crea un efecto de silueta con contorno luminoso y fondo sobreexpuesto
- "Solo luz de luna" da como resultado sombras de tono azulado y alto contraste, con muy poco relleno ambiental
- "Niebla matinal volumétrica" añade dispersión atmosférica que interactúa con todas las fuentes de luz
La dirección de la luz importa tanto como su calidad. "Luz de la mañana desde la derecha" o "lámpara cálida de lado detrás del sujeto" dan al modelo una fuente de luz espacial con la que trabajar, lo que mejora de forma notable la coherencia de las sombras y el detalle de las superficies en todo el clip.
La hora del día como capa del prompt

Piensa en la hora del día como un conjunto de condiciones predefinidas. Le indica al modelo la temperatura de color de la fuente de luz dominante, el ángulo y la longitud de las sombras, el nivel de actividad ambiental del entorno y la densidad de la neblina atmosférica.
- "3 de la madrugada en una ciudad vacía" implica luz artificial naranja en la calle, casi silencio, calles desiertas y sombras profundas bajo los toldos
- "Mediodía en un mercado abarrotado" implica sol cenital duro, sombras profundas y cortas justo debajo de los sujetos, y un encuadre lleno de gente y color
- "Crepúsculo sobre el océano" implica un degradado de horizonte violeta y rosa, reflejos largos sobre el agua y un paso gradual de tonos cálidos a fríos
No necesitas detallar todas esas subcondiciones una a una. La expresión temporal contiene la mayoría de ellas de forma implícita. Aprovecha ese conocimiento implícito de forma deliberada.
Lo que hace tropezar a Sora 2
Incluso un modelo sofisticado tiene modos de fallo que conviene conocer. Reconocer estos patrones te ayuda a evitar estructuras de prompt que desperdician generaciones y producen resultados confusos.
Instrucciones contradictorias

El fallo más común en un prompt es la contradicción interna. Estos son ejemplos que provocan resultados degradados:
- "Un Times Square abarrotado sin nadie" — el modelo no puede cumplir ambas cosas a la vez
- "Una escena interior soleada iluminada solo por velas" — fuentes de luz dominantes en competencia sin una jerarquía definida
- "La cámara está a la vez quieta y haciendo un zoom lento" — una contradicción directa de movimiento
- "Una ciudad medieval antigua con rascacielos de cristal modernos al fondo" — incoherencia temporal
Cuando el modelo recibe señales contradictorias, normalmente las resuelve promediándolas o alternándolas, lo que significa que ninguna de las instrucciones se cumple del todo. El resultado es un compromiso visual que no satisface claramente nada.
Solución: define una condición dominante y usa un lenguaje matizador para los elementos secundarios. "Un Times Square casi vacío a las 6 de la mañana, con algunas figuras lejanas visibles en la acera del fondo" resuelve la tensión sin contradicción.
Conceptos abstractos frente a escenas concretas
Sora 2 tiene dificultades con las abstracciones puras. Palabras como "soledad", "el paso del tiempo" o "el peso de la memoria" son ideas poderosas, pero no se traducen en instrucciones espaciales o visuales concretas que el modelo pueda ejecutar.
La solución más fiable es la metáfora visual: traduce el concepto abstracto en una escena concreta que sugiera el sentimiento.
- En lugar de "soledad": "una sola persona sentada a una mesa grande y vacía, todas las demás sillas libres, la última luz de la ventana desvaneciéndose poco a poco"
- En lugar de "el paso del tiempo": "un timelapse de sombras que giran sobre una pared blanca y vacía durante varias horas, mientras el sol avanza"
- En lugar de "tensión": "dos personas de pie a casi un metro de distancia en un pasillo estrecho, ambas mirando al frente, ninguna de las dos se mueve"
💡 Tip: Si tu concepto es abstracto, pregúntate: ¿cómo rodaría esto de verdad un director de cine para el público de una sala de cine? Esa respuesta suele ser el prompt correcto.
Cómo usar Sora 2 en PicassoIA

Sora 2 está disponible directamente en la plataforma PicassoIA. No necesitas clave de API ni configuración técnica. Así se usa, paso a paso.
Guía paso a paso
- Abre la página del modelo: entra en Sora 2 en PicassoIA desde cualquier navegador
- Escribe tu prompt: aplica los principios de este artículo. Estructúralo así: sujeto + acción + entorno + iluminación + ángulo de cámara + hora del día
- Configura la resolución: Sora 2 admite hasta 1080p. Empieza con 720p durante la iteración para generar más rápido y luego escala para tu versión final
- Configura la duración: los clips cortos (5-8 segundos) se generan más rápido y son más fáciles de evaluar. Los clips largos introducen más riesgo de deriva temporal
- Lanza la primera generación: tómala como diagnóstico. Úsala para evaluar qué elemento del prompt necesita ajustes, no como resultado final
- Refina una variable cada vez: si la iluminación es incorrecta, actualiza solo la descripción de la luz. Si el ángulo de cámara no es el correcto, corrige solo eso. Cambiar varios elementos a la vez hace imposible saber qué ayudó
- Escala para la versión final: cuando el prompt produzca un resultado satisfactorio a 720p, cambia a 1080p para la entrega
Para una calidad de producción superior y un tiempo de generación más largo con un detalle más fino, prueba Sora 2 Pro, que usa la misma arquitectura con una configuración de muestreo de mayor fidelidad.
Consejos sobre parámetros
| Parámetro | Ajuste recomendado | Por qué |
|---|
| Resolución | 720p para pruebas, 1080p para las versiones finales | Iteración más rápida sin perder la respuesta del prompt |
| Duración | 5-8 segundos | Suficiente para evaluar el movimiento, lo bastante corto para iterar rápido |
| Longitud del prompt | 50-100 palabras | El punto ideal para un control coherente de la escena |
| Prompt negativo | "borroso, sobreexpuesto, inestable, baja calidad" | Evita los artefactos más comunes |
| Semilla | Fija durante el refinamiento | Te permite aislar el efecto de los cambios en el prompt |
💡 Tip: Haz de 2 a 3 generaciones con exactamente el mismo prompt antes de cambiar nada. Sora 2 tiene una variación natural en los resultados, y lo que parece un problema del prompt puede ser simplemente un resultado atípico que una segunda ejecución evita.
Otros modelos que merece la pena comparar

Si tu caso de uso no encaja con lo que produce Sora 2, PicassoIA ofrece una buena selección de alternativas con fortalezas distintas:
- Kling v2.6: excelente para el movimiento humano cinematográfico y para escenas de primer plano con mucha expresividad emocional. Maneja el detalle del rostro con una constancia notablemente alta.
- Wan 2.6 T2V: sólido para escenas ambientales, paisajes amplios y planos arquitectónicos panorámicos con física natural.
- Veo 3: el modelo insignia de Google, con generación de audio sincronizado nativo. La opción adecuada cuando el sonido ambiente forma parte de la entrega.
- Kling v3 Video: fiable para el control de movimiento cinematográfico con una salida temporal precisa. Va bien cuando la constancia importa más que la variedad.
- Gen 4.5: la propuesta de RunwayML, con una fuerte coherencia narrativa de escenas en clips más largos.
Cada modelo tiene sensibilidades distintas al prompt y sesgos de entrenamiento diferentes. Lo que funciona con Sora 2 no se trasladará a la perfección a todas las alternativas, pero los principios estructurales de este artículo se aplican de forma amplia a todas ellas: sé preciso, usa lenguaje de cámara, describe la dirección de la luz y evita las contradicciones internas.
Empieza a crear ahora
Escribir mejores prompts es una habilidad que mejora rápido con práctica deliberada. La diferencia entre un resultado olvidable y algo que detiene al espectador en mitad del scroll casi siempre está en las 20 palabras que describen la iluminación y el ángulo de cámara, no en el sujeto en sí.
Elige una escena que hayas estado imaginando. Escríbela siguiendo el esquema de este artículo: sujeto, acción, entorno, dirección de la luz, tipo de cámara y hora del día. Ejecútala en Sora 2 y estudia lo que devuelve.
El modelo ya sabe cómo funciona la física, cómo se comporta la luz y cómo se mueve una cámara por el espacio. Tu trabajo es simplemente darle las instrucciones correctas.
Empieza a crear hoy en PicassoIA y descubre hasta dónde puede llevarte una frase bien construida.