Todos los modelos de video de IA aseguran que "hacen cine". Veo 3.1 lo cumple de verdad. La última versión de Google incluye algo que ningún otro modelo ha logrado a escala: control de cámara cinematográfico guiado por prompts que responde al lenguaje de los cineastas reales. Travellings hacia delante, planos de seguimiento, barridos aéreos, cambio de foco, ángulos holandeses. No son artefactos de movimiento aleatorios. Son deliberados, responden bien y son sorprendentemente constantes cuando sabes cómo pedirlos.
Esto es lo que encontramos tras poner a prueba todos los grandes movimientos de cámara: decenas de prompts en Veo 3.1, registrando los fallos, repitiendo las pruebas y comparándolo cara a cara con los generadores de video de IA actuales.
Qué significa el control de cámara en Veo 3.1
"Control de cámara" es un término cargado. En la mayoría de los modelos de video de IA, significa que la escena se mueve. Los objetos se desplazan, el viento mueve el pelo, un personaje gira la cabeza. Eso es movimiento, no control de cámara.
Veo 3.1 distingue entre ambos. La cámara es una entidad propia, con su propio movimiento, independiente de la acción del sujeto. Cuando escribes "dolly in lento hacia un hombre sentado en la barra", la cámara avanza físicamente por el espacio hacia el sujeto. El hombre no se inclina hacia ti. La cámara se mueve hacia él.
Esta distinción importa enormemente para contar historias. Un dolly in crea intimidad psicológica. Un dolly out crea aislamiento. Una grúa descendente aérea transmite llegada y escala. No son intercambiables. Veo 3.1 entiende cuál quieres.
El vocabulario al que responde
Veo 3.1 se entrenó con vocabulario cinematográfico real. Estos términos produjeron de forma constante el resultado previsto en nuestras pruebas:
- Dolly in / Dolly out: la cámara avanza o retrocede físicamente por el espacio
- Pan left / Pan right: la cámara gira sobre su eje vertical
- Tilt up / Tilt down: la cámara gira sobre su eje horizontal
- Crane up / Crane down: la cámara se desplaza verticalmente por el espacio en un arco vertical
- Tracking shot: la cámara sigue al sujeto lateralmente a una distancia constante
- Aerial / Bird's eye: perspectiva cenital, a menudo combinada con movimiento hacia delante
- Low angle: la cámara se sitúa por debajo de la línea de los ojos del sujeto, mirando hacia arriba
- Dutch angle: la cámara se inclina sobre su eje de alabeo, creando un encuadre inclinado
- Rack focus: el plano de enfoque cambia entre sujetos del primer plano y del fondo
- Whip pan: panorámica rápida que crea una transición con desenfoque por movimiento entre cortes
- Handheld: leve temblor orgánico de cámara, sin estabilizar
Términos que no funcionaron de forma fiable: "zoom" (a menudo producía un zoom digital en lugar de óptico), "efecto vértigo" (resultados desiguales) y "órbita de 360" (en la mayoría de las pruebas se convertía en un paneo parcial).

Los planos que probamos
Organizamos las pruebas en siete categorías cinematográficas principales. Esto es lo que encontramos.
Planos generales de establecimiento
El plano general de establecimiento es la base de la mayoría de las secuencias cinematográficas. Veo 3.1 los resuelve con un naturalismo sorprendente, sobre todo cuando se combina con una grúa lenta o un movimiento aéreo.
Mejor estructura de prompt: [Location description] + [time of day and weather] + [camera movement, e.g., slow crane up from ground level to reveal the full skyline] + [film grain and lens description]
Resultado: Veo 3.1 produjo planos generales de establecimiento coherentes, en los que el movimiento de cámara coincidía con el arco descrito. Un "crane up lento desde el nivel del suelo" de verdad empezaba a ras de suelo, subía con regularidad y se asentaba en una vista amplia. Es el comportamiento de un operador de cámara bien programado.

Planos de dolly
En los planos de dolly, Veo 3.1 se separa de verdad de la competencia. La ilusión de profundidad física que crea un movimiento de dolly real es notoriamente difícil de simular por computación. La mayoría de los modelos de IA producen un zoom digital en su lugar, que comprime la profundidad en lugar de recorrerla.
Veo 3.1 produjo un movimiento de dolly genuino en aproximadamente el 80% de las pruebas. El 20% restante mostró un híbrido, en parte dolly y en parte zoom. Cuando se producían fallos, añadir la frase "la cámara avanza físicamente, no es zoom, es un movimiento de dolly real" al prompt elevó la tasa de éxito cerca del 95%.
💡 Consejo pro: distingue siempre explícitamente entre dolly y zoom en tu prompt. Escribe: "dolly in lento hacia el sujeto, la cámara avanza físicamente por el espacio, no es un zoom." Este pequeño añadido marca una diferencia medible en la fidelidad de la imagen.
Planos de seguimiento
Los planos de seguimiento, en los que la cámara sigue lateralmente a un sujeto en movimiento, funcionaron bien cuando el sujeto estaba claramente definido y la dirección del movimiento era explícita.
Lo que funcionó: "Track the subject left to right as they walk along the sidewalk, camera at shoulder height, maintaining consistent distance of 3 meters"
Lo que no funcionó de forma fiable: seguir a un sujeto alrededor de una esquina o a través de una multitud. El modelo a veces perdía la continuidad del sujeto cuando aparecían obstáculos.

Planos aéreos y de dron
Los planos aéreos de Veo 3.1 son realmente impresionantes. La física del movimiento aéreo, la sutil rotación del plano de perspectiva y la forma en que las sombras se alargan con el sol bajo se renderizan con una autenticidad que aguanta el escrutinio.
El modelo responde bien a:
- "Vista cenital mirando directamente hacia abajo"
- "Plano aéreo con avance lento hacia delante"
- "Grúa aérea descendente hacia el sujeto"
Evita "drone shot" como término. "Aerial" produjo de forma constante mejores resultados en nuestras pruebas.
Planos de ángulo bajo y ángulo holandés

Los planos de ángulo bajo de Veo 3.1 muestran una distorsión de perspectiva adecuada cuando se especifican ángulos extremos. Escribir "cámara situada a 15 cm sobre el suelo, mirando hacia arriba con un ángulo de 45 grados" produce un resultado notablemente distinto de "plano de ángulo bajo". Aquí la precisión gana siempre.
Los ángulos holandeses (encuadre inclinado) fueron menos constantes. El modelo entendió la intención en aproximadamente el 65% de las pruebas, pero el grado de inclinación fue impredecible. Especifica el ángulo numéricamente: "cámara inclinada 15 grados en sentido antihorario sobre su eje de alabeo".
Cambio de foco
Las secuencias de cambio de foco, en las que el plano de enfoque pasa de un sujeto a otro, representaron una de las capacidades más impresionantes de Veo 3.1. En nuestra prueba de la cafetería ("cambio de foco desde la taza de café en primer plano hasta el rostro de la mujer en el fondo"), el cambio fue suave, tenía una motivación clara y estaba bien sincronizado dentro del clip.

Esto es significativo. El cambio de foco exige que el modelo trate la profundidad como un recurso narrativo temporal. La mayoría de los modelos rivales aplanan la profundidad en un campo estático de poca profundidad o producen un desenfoque gradual sin una intención direccional clara.
Movimiento handheld y documental
En el modo handheld, Veo 3.1 mostró el movimiento que parecía más natural. Los micromovimientos orgánicos, la leve respiración del encuadre y el horizonte imperfecto resultaban auténticos. Esto se debe a que el movimiento handheld no requiere una corrección matemática precisa. Es más fácil simular un caos controlado que un movimiento de dolly mecánico y preciso.
Cómo pedir movimientos de cámara
El factor más importante del control de cámara de Veo 3.1 es la precisión del prompt. Los prompts vagos producen resultados vagos. Los prompts cinematográficos producen resultados cinematográficos.
La fórmula del prompt de cuatro capas
Estructura cada prompt de cámara en cuatro capas:
- Sujeto y escena: quién o qué está en el encuadre, dónde y haciendo qué
- Posición de cámara: altura, ángulo, distancia respecto al sujeto
- Movimiento de cámara: tipo exacto de movimiento, dirección y velocidad
- Atmósfera visual: condiciones de iluminación, grano de película, tipo de objetivo
Ejemplo que funciona:
"Una mujer con un vestido rojo se detiene al final de un muelle largo y vacío sobre el océano al atardecer. Cámara situada a la altura de la rodilla, ligeramente inclinada hacia arriba, a 10 metros. Dolly in lento hacia el sujeto durante 8 segundos, la cámara avanza físicamente por el espacio, no es zoom. Contraluz cálido naranja del sol poniente, grano de película, objetivo de 50 mm, fotorrealista."
Compáralo con: "Una mujer en un muelle, cinematográfico."
El primer prompt le da a Veo 3.1 todo lo que necesita. El segundo es cuestión de suerte.
Lenguaje de velocidad que funciona
Veo 3.1 responde a los descriptores de velocidad relativa con resultados constantes:
| Descriptor de velocidad | Lo que produce |
|---|
| "Very slow" / "imperceptibly slow" | Movimiento casi estático, meditativo |
| "Slow" | Movimiento deliberado y claramente visible |
| "Medium" / "steady" | Ritmo documental normal |
| "Fast" | Movimiento enérgico, orientado a la acción |
| "Rapid" / "whip" | Transiciones de alta velocidad |
Combinar movimientos de cámara
Puedes combinar movimientos de cámara, pero usa una señal temporal. En lugar de "dolly in y tilt up", escribe "empieza con un dolly in lento y luego haz un tilt up para revelar el skyline al final del movimiento". Las instrucciones secuenciales funcionan mejor que las simultáneas.

Veo 3.1 frente a la competencia
El control de cámara es poco común en los generadores de video de IA. Así se compara el panorama actual:
Por qué Veo 3.1 lidera: la ventaja principal es la fidelidad del prompt al vocabulario del cine. Veo 3.1 se entrenó con un corpus que incluye producciones cinematográficas reales. Cuando dices "Dutch angle", sabe qué es un Dutch angle y por qué lo usan los cineastas.
Dicho esto, Kling v3 Motion Control merece reconocimiento por su sistema de control de trayectorias, que permite a los usuarios dibujar manualmente las rutas de cámara. Es un enfoque distinto, más visual que textual, y funciona bien para quienes prefieren dibujar el movimiento a describirlo.
Ray 3.2 de Luma produce algunos de los fotogramas más pulidos visualmente de la categoría, con un render HDR que compite con Veo 3.1 en fotorrealismo puro, o lo supera. Donde se queda corto es en la fidelidad del movimiento de cámara. El "dolly in" de Ray 3.2 a menudo se interpreta como un zoom.
Video 01 Director adopta un enfoque estructurado con un menú predefinido de movimientos de cámara. Es fiable precisamente porque tiene restricciones. Pero las restricciones significan que no puedes pedir un plano de seguimiento con ángulo holandés y cámara en mano alrededor de una esquina. Veo 3.1 puede intentarlo y, a menudo, lo consigue.
Usar Veo 3.1 en PicassoIA
Veo 3.1 está disponible directamente en PicassoIA, junto a sus modelos hermanos. La plataforma aloja las tres variantes: el Veo 3.1 completo, el más rápido Veo 3.1 Fast y el ligero Veo 3.1 Lite.
Qué versión usar
- Veo 3.1: úsalo cuando necesites la máxima fidelidad de control de cámara y la mayor calidad. Ideal para renders finales, trabajos para clientes y clips principales.
- Veo 3.1 Fast: úsalo para iterar y probar. Redacta aquí tu prompt de cámara, comprueba que el movimiento funciona y luego pasa al modelo completo.
- Veo 3.1 Lite: úsalo para bocetos conceptuales rápidos o cuando la velocidad de generación importa más que el cumplimiento preciso de la cámara.
El flujo de trabajo de iteración
El control de cámara en el video de IA recompensa la iteración. Nuestro flujo de trabajo recomendado en PicassoIA:
- Redacta tu prompt de cámara con la fórmula de cuatro capas de arriba
- Genera un clip de prueba con Veo 3.1 Fast
- Revisa si el movimiento de cámara coincidió con tu intención
- Ajusta el lenguaje y vuelve a probar
- Cuando el movimiento sea el correcto, genera la versión final con Veo 3.1
Esto ahorra un tiempo de generación considerable y asegura que el resultado final coincida con lo que pretendías.

PicassoIA también aloja alternativas sólidas que complementan a Veo 3.1 en escenarios concretos. Kling v3 Video maneja secuencias de acción con un alto realismo físico. Pixverse v6 ofrece un resultado cinematográfico con audio sincronizado para escenas emotivas. Seedance 2.5 produce clips de 30 segundos excepcionalmente constantes cuando se necesitan grabaciones más largas.
Cuando el control de cámara falla
Veo 3.1 no es perfecto. Conocer sus modos de fallo es tan importante como conocer sus puntos fuertes.
Continuidad del sujeto en movimientos largos
En los movimientos de cámara largos que cubren una distancia espacial considerable (más de 3 segundos de recorrido de dolly), los sujetos a veces se desplazan dentro del encuadre. Un sujeto que debería permanecer centrado migra poco a poco hacia un lado durante un push-in prolongado. Parece un problema de coherencia temporal, no un problema matemático de cámara.
Solución: para los movimientos largos, divide en dos clips. Genera por separado el inicio y el final del movimiento y luego únelos en la edición.
Movimiento simultáneo del sujeto y de la cámara
Cuando la cámara y un sujeto principal se mueven al mismo tiempo, el control de cámara se degrada de forma notable. Un plano de seguimiento de una persona corriendo funciona bien. Un plano de seguimiento de una persona corriendo en el que la cámara además sube con una grúa produce resultados impredecibles. El modelo prioriza el movimiento del sujeto sobre el de la cámara cuando ambos compiten.
Solución: si necesitas un movimiento combinado complejo, las herramientas de dibujo de trayectorias de Kling v3 Motion Control gestionan el movimiento combinado de forma más fiable mediante una especificación explícita de la ruta.
Interiores con bajo contraste
El movimiento de cámara en interiores oscuros o de bajo contraste produjo con frecuencia artefactos de desenfoque por movimiento. El modelo tenía dificultades para calcular los cambios de posición de la cámara en entornos donde las pistas de profundidad espacial eran ambiguas. Las escenas bien iluminadas con una separación clara entre primer plano y fondo funcionaron significativamente mejor.

El problema de zoom frente a dolly
Este es el modo de fallo más común de Veo 3.1. La distinción entre dolly y zoom es computacionalmente sutil: ambos hacen que el sujeto se vea más grande en el encuadre, pero el dolly cambia el paralaje y el zoom no. En aproximadamente el 20% de las pruebas sin lenguaje explícito contra el zoom, Veo 3.1 recurrió a un zoom.
La solución es sencilla y constante: añade "no es zoom, movimiento de cámara real a través del espacio, paralaje visible en los elementos del fondo" a cualquier prompt de dolly o push.
Qué cambia esto para los cineastas de IA
La cinematografía siempre ha tratado de control. No solo de lo que filmas, sino de cómo la cámara lo encuadra, lo recorre y lo revela al espectador.
Hasta ahora, los modelos de video de IA daban al creador control sobre el sujeto, pero no sobre la cámara. Podías poner a un personaje en una escena. Podías hacer que caminara. Pero la cámara era una observadora pasiva, no una participante creativa.
Veo 3.1 cambia esa relación. La cámara es ahora un instrumento que puedes dirigir con el lenguaje. No de forma perfecta, ni siempre a la primera, pero sí con la suficiente constancia como para construir en torno a ella un flujo de producción real.
Para los creadores de contenido de formato corto, esto significa variedad de planos dentro de un mismo clip, no solo variedad de contenido. Un plano protagonista, un primer plano de reacción, un general de establecimiento, un seguimiento final. Son decisiones cinematográficas reales al alcance de un texto.
Para los cineastas de narrativa que prototipan historias, esto significa pruebas del lenguaje visual antes de cualquier producción física. Puedes comprobar si un ángulo holandés funciona en una escena psicológica, o si una revelación con grúa lenta encaja en una secuencia de llegada, antes de pasar un día en el set.
💡 Los modelos de video disponibles en PicassoIA, desde Veo 3.1 hasta Ray 3.2, Kling v3 y Seedance 2.5, hacen avanzar el arte cada mes. La distancia entre el video de IA y la producción profesional se está reduciendo más rápido de lo que la mayoría de la industria imagina.

Pruébalo en PicassoIA
Si nunca has probado el control de cámara de Veo 3.1 directamente, empieza con una comparación sencilla. Ejecuta dos veces la misma descripción de escena: una sin lenguaje de cámara y otra con la fórmula de cuatro capas aplicada.
Sin control de cámara:
"Una mujer de pie junto a una ventana, mirando la lluvia."
Con control de cámara:
"Una mujer de pie junto a una ventana, mirando la lluvia. Cámara situada a media distancia, ligeramente por debajo de la altura de los ojos. Dolly in lento durante 6 segundos, la cámara avanza físicamente por el espacio hacia ella, no es zoom. Luz suave de ventana nublada desde la derecha, equivalente a 50 mm, grano de película Kodak."
La diferencia te dirá todo sobre por qué importa el vocabulario de control de cámara. Dos prompts que describen la misma escena. Uno es una fotografía. El otro es una película.
Veo 3.1, Veo 3.1 Fast y Veo 3.1 Lite ya están disponibles en PicassoIA. También hay otros 117 modelos de video, 91 generadores de imágenes, herramientas de superresolución, editores de video y el conjunto completo de herramientas de producción de contenido con IA en picassoia.com/en/all-models.
El vocabulario cinematográfico que ya conoces como cineasta funciona con Veo 3.1. Apunta la cámara. Anuncia el plano. Graba.