Nombre de la API de Veo 3.1: IDs de modelo para Veo 3.1, Fast y Lite
Los tres IDs de modelo de Veo 3.1 en la API de Gemini, uno al lado del otro: estándar, Fast y Lite. Consulta qué resoluciones y duraciones de clip admite cada uno, cuánto cuesta cada segundo de video, cómo llamarlos en Python y cómo usarlos desde tu navegador.
Pegas un nombre de modelo en tu script, lo ejecutas y recibes un error en lugar de un video. Con Veo 3.1 esto pasa más a menudo de lo que debería, porque el nombre en un anuncio de lanzamiento, el nombre en la API de Gemini y el nombre en una plataforma externa son tres cadenas distintas. Esta página recoge los IDs exactos de Veo 3.1, Veo 3.1 Fast y Veo 3.1 Lite, lo que hace cada uno, cuánto cuesta cada segundo y cómo llamarlos sin adivinar.
En resumen: en la API de Gemini, los tres nombres son veo-3.1-generate-preview, veo-3.1-fast-generate-preview y veo-3.1-lite-generate-preview. Lo que sigue explica por qué tienen esa forma, cuál encaja con tu trabajo y cómo ejecutar los mismos modelos en PicassoIA cuando prefieras hacer clic que programar. Si una petición falla de inmediato, compara tu cadena con la tabla de abajo antes de tocar cualquier otra cosa, porque un error de un solo carácter es fácil de cometer y difícil de ver en un script largo.
Los tres IDs de modelo
La documentación de la API de Gemini de Google enumera estos códigos para la familia Veo 3.1. Cópialos exactamente, incluido el final -preview.
💡 Consejo: los IDs son cadenas literales. veo-3.1, veo3.1 y veo-3-1-fast no son ninguno de los tres códigos de arriba, así que una petición que los use está pidiendo un modelo que la lista de Google no contiene.
Veo 3.1 estándar
veo-3.1-generate-preview encabeza la familia. Según la tabla de propiedades de Google, acepta texto o imagen como entrada, devuelve video con audio generado de forma nativa y ofrece salida en 720p, 1080p y 4k. Los clips duran 4, 6 u 8 segundos, y 1080p y 4k están limitados a 8 segundos. Elígelo cuando el clip sea el entregable final y el presupuesto lo permita.
Veo 3.1 Fast
veo-3.1-fast-generate-preview comparte las mismas filas de entrada, salida, resolución y duración que el modelo estándar en la tabla de Google. Lo que cambia es la contrapartida: un precio por segundo más bajo y esperas más cortas. En los ejemplos publicados en su página de PicassoIA, los clips Fast terminaron en unos 45 a 59 segundos, frente a 72 a 114 segundos en los ejemplos de la página del Veo 3.1 estándar.
Veo 3.1 Lite
veo-3.1-lite-generate-preview es el nivel más económico. Admite 720p y 1080p (solo 8 segundos), no tiene salida en 4k, y la documentación de Google indica que la extensión de video no está disponible para él. Los ejemplos de la página de Veo 3.1 Lite terminaron en unos 37 a 42 segundos. Piénsalo como el nivel de volumen: muchos borradores, clips para redes sociales y fondos en bucle.
De dónde salen los nombres
Cómo leer el patrón
Cada ID sigue una misma forma: versión, nivel opcional, la palabra generate y luego una etapa de lanzamiento. Así, veo-3.1-fast-generate-preview se lee como Veo 3.1, nivel Fast, generate, etapa preview.
Los modelos Veo 3 anteriores usan un sufijo de etapa distinto. veo-3.0-generate-001 y veo-3.0-fast-generate-001 figuran como estables, con clips de 8 segundos en 720p o 1080p. Si quieres esos en PicassoIA, son Veo 3 y Veo 3 Fast.
Preview significa que Google todavía puede cambiar el comportamiento, los límites o el precio. Guarda la cadena en una única constante de configuración, para que una sola edición actualice todo tu proyecto el día que cambie un nombre.
¿Estable o preview? Si tu producto no puede tolerar que un modelo cambie de nombre o de precio, el par estable Veo 3 es la base más segura, siempre que los clips de 8 segundos en 720p o 1080p basten. Si necesitas duraciones de 4, 6 u 8 segundos, el nivel Lite más barato o la salida en 4k, estás en terreno preview y debes contar con cambios. Registra la cadena del modelo junto a cada archivo generado para poder reproducir o auditar un resultado meses después.
Nombres en otras plataformas
Nunca pegues una cadena de la API de Gemini en otra plataforma. PicassoIA cataloga estos modelos bajo el propietario google, con nombres que eliminan las palabras generate y preview, y slugs de página que eliminan los puntos.
Dónde
Veo 3.1
Fast
Lite
API de Gemini
veo-3.1-generate-preview
veo-3.1-fast-generate-preview
veo-3.1-lite-generate-preview
Nombre del modelo en PicassoIA
google/veo-3.1
google/veo-3.1-fast
google/veo-3.1-lite
Slug de la página en PicassoIA
google-veo-31
google-veo-31-fast
google-veo-31-lite
La regla práctica: una herramienta que se comunica con la API de Gemini necesita veo-3.1-generate-preview, mientras que una herramienta o catálogo que trabaja con pares de propietario y nombre necesita google/veo-3.1. Mezclar los dos es una forma fácil de acabar pidiendo un modelo que no existe.
Vertex AI de Google Cloud mantiene su propio listado de modelos. Lee el ID en esa consola en lugar de suponer que coincide con la cadena de la API de Gemini.
Especificaciones una al lado de otra
Todas las cifras de abajo proceden de la documentación de la API de Gemini de Google para Veo.
Propiedad
Veo 3.1
Veo 3.1 Fast
Veo 3.1 Lite
Veo 3 y Fast
Entrada
Texto, imagen
Texto, imagen
Texto, imagen
Texto, imagen
Salida
Video con audio
Video con audio
Video con audio
Video con audio
Resolución
720p, 1080p, 4k
720p, 1080p, 4k
720p, 1080p
720p, 1080p
Duración
4, 6 u 8 s
4, 6 u 8 s
4, 6 u 8 s
8 s
Estado
Preview
Preview
Preview
Estable
La regla del 1080p
Google vincula 1080p (y 4k en los modelos que lo tienen) a clips de 8 segundos, y la forma Lite de PicassoIA repite la misma regla: la duración debe ser 8 cuando eliges 1080p. Trata la resolución y la duración como un par. Un clip de 4 o 6 segundos significa 720p.
Lo que Lite deja fuera
Además de 4k y la extensión de video, la forma Lite de PicassoIA no tiene campo de prompt negativo, interruptor de audio ni imágenes de referencia. El formulario del modelo estándar tiene las tres cosas, y Fast conserva el prompt negativo y el interruptor de audio. Si tu flujo de trabajo depende de imágenes de referencia para mantener un personaje estable, Lite es el nivel equivocado.
Cuánto cuesta cada llamada
Google cobra Veo por segundo de video generado. Estos son los precios con audio de su página de precios en el momento de escribir esto, más el costo de un clip de 8 segundos.
Modelo
720p por segundo
1080p por segundo
4k por segundo
Clip de 8 s en 1080p
Veo 3.1
$0.40
$0.40
$0.60
$3.20
Veo 3.1 Fast
$0.10
$0.12
$0.30
$0.96
Veo 3.1 Lite
$0.05
$0.08
No admitido
$0.64
💡 Revisa antes de presupuestar: son modelos preview, y los precios preview pueden cambiar. Google también indica que solo se te cobra cuando un video se genera correctamente.
Borradores baratos, acabados caros
Haz números con un lote real. Diez borradores de 8 segundos en Lite a 720p cuestan 10 x $0.40 = $4.00. Tres retoques en Fast a 1080p cuestan 3 x $0.96 = $2.88. Un final en el estándar a 1080p cuesta $3.20. Total: $10.08. Hacer los catorce clips en el estándar a 1080p costaría 14 x $3.20 = $44.80 por el mismo número de generaciones.
Los borradores más cortos ahorran todavía más. Un clip de 4 segundos se permite en 720p, así que un borrador en Lite cuesta 4 x $0.05 = $0.20, un borrador en Fast cuesta $0.40 y un borrador en el estándar cuesta $1.60. Define el movimiento de cámara y el sonido en borradores de 4 segundos, y luego gasta los 8 segundos una vez que el prompt funcione.
En PicassoIA generas desde el navegador, así que no hay un contador por segundo en tu propio código que vigilar. Los límites dependen de tu plan, así que revísalos antes de una tanda grande.
Una llamada de Python que funciona
La documentación de Google muestra el patrón de abajo para el modelo estándar. Usa el SDK google-genai, inicia una operación de larga duración y la consulta hasta que el video esté listo. El cliente lee tu credencial de Gemini desde el entorno, así que configúrala como describe Google AI Studio antes de ejecutarlo.
import time
from google import genai
from google.genai import types
client = genai.Client()
prompt = "A slow dolly shot along a rainy street at dusk, a street musician plays saxophone, rain and distant traffic in the audio"
operation = client.models.generate_videos(
model="veo-3.1-generate-preview",
prompt=prompt,
)
while not operation.done:
print("Waiting for video generation to finish...")
time.sleep(10)
operation = client.operations.get(operation)
generated_video = operation.response.generated_videos[0]
client.files.download(file=generated_video.video, destination="output.mp4")
Cambiar de nivel modifica un único argumento. Guarda los tres nombres en un diccionario y pasa el que necesites:
La llamada devuelve una operación, no un video. Tu bucle consulta operation.done cada 10 segundos y después descarga el archivo. Calcula esperas de uno o dos minutos en el modelo estándar y menos en Fast y Lite, según los tiempos de los ejemplos de arriba. No vuelvas a enviar la petición mientras una operación siga en curso, o generarás (y pagarás) un segundo clip.
Errores que hacen perder dinero
Sufijo que falta.veo-3.1-generate sin -preview no es un código listado.
4k en Lite. Este nivel no lo ofrece.
1080p con un clip de 6 segundos. Pon 8 segundos o baja a 720p.
Extender un clip de Lite. Google dice que la extensión no está disponible para Lite.
Dispersar las cadenas. Si escribes el ID de forma fija en diez archivos, renombrarlo cuesta una tarde.
Antes de encolar un lote, repasa esta breve lista de comprobación:
La cadena del modelo coincide con uno de los tres códigos de la primera tabla, carácter por carácter.
La resolución y la duración forman un par válido: 1080p significa 8 segundos.
El nivel elegido admite lo que necesitas: 4k, extensión e imágenes de referencia no están en Lite.
Registraste la cadena del modelo y el prompt junto a cada archivo de salida.
Multiplicaste el precio por segundo por el número de clips antes de pulsar ejecutar.
Qué modelo encaja con tu trabajo
Trabajo
Mejor nivel
Por qué
Pruebas de prompts y storyboards
Fast
Precio bajo, entrega rápida
Clip final protagonista o entrega en 4k
Veo 3.1 estándar
Techo de resolución más alto
Clips verticales diarios para redes sociales
Lite
El más barato por segundo
Mantener un mismo sujeto estable entre planos
Veo 3.1 estándar
Imágenes de referencia en PicassoIA
Fast para iterar
La mayoría de los prompts necesitan entre tres y cuatro reescrituras hasta que el movimiento de cámara y el sonido quedan donde quieres. Haz esas reescrituras en Veo 3.1 Fast y luego pasa el prompt ganador al modelo estándar.
Como todos los niveles devuelven audio nativo, escribe el sonido en el prompt. Los prompts de ejemplo de PicassoIA hacen exactamente eso: el silbato de un tren y el ruido ambiente de una estación, jazz suave con lluvia golpeando un cristal, una línea de diálogo hablado entre comillas. Un prompt que nombra el sonido le da al modelo algo sobre lo que construir la pista de audio, y notarás la diferencia entre borradores enseguida.
Estándar para los acabados
Cuando un clip vaya a estar en una página de aterrizaje, en una presentación para un cliente o en una pantalla grande, el costo extra de Veo 3.1 se justifica con facilidad. También es el único nivel de esta familia con imágenes de referencia en PicassoIA, y comparte la fila de 4k con Fast en la tabla de Google.
Lite para el volumen
Veo 3.1 Lite encaja en cualquier flujo de trabajo en el que necesites decenas de clips cortos: bucles de producto, publicaciones verticales, metraje de fondo para un pódcast. Cambia la relación de aspecto a 9:16 y fija 720p para el resultado más barato.
Cómo usar Veo 3.1 en PicassoIA
Sin código, sin credenciales, la misma familia de modelos. Estos son los pasos en la página de Veo 3.1:
Escribe el prompt. Es el único campo obligatorio. Describe el sujeto, el movimiento de cámara, la luz y el sonido que quieres oír.
Fija la duración. Elige 4, 6 u 8 segundos. El valor por defecto es 8.
Fija la resolución y la relación. Elige 720p o 1080p (el valor por defecto es 1080p), y 16:9 o 9:16.
Deja el audio activado. La opción de audio viene activada por defecto. Añade un prompt negativo para todo lo que quieras excluir.
Genera y descarga. Espera al clip y guarda el archivo.
Fotogramas e imágenes de referencia
Añade una imagen de entrada para partir de tu propio primer fotograma. Añade también un último fotograma y el modelo construye una transición entre los dos. Las imágenes ideales son de 16:9 o 9:16, en 1280x720 o 720x1280, según la relación que elijas.
Para mantener un sujeto coherente, sube de una a tres imágenes de referencia en su lugar. Esto funciona solo en el modelo estándar, y únicamente con 16:9 y 8 segundos. Si proporcionas imágenes de referencia, se ignora el último fotograma, así que elige un método por clip.
Fast y Lite en PicassoIA
Veo 3.1 Fast usa 1080p por defecto y conserva el prompt negativo y el interruptor de audio. Veo 3.1 Lite usa 720p por defecto y requiere 8 segundos siempre que elijas 1080p.
💡 ¿Programas contra PicassoIA? En el momento de escribir esto, la API para desarrolladores de PicassoIA listaba cuatro de sus propios modelos, incluidos PicassoIA Video y Seedance 2.5 Lite, en lugar de los modelos Veo de Google. Los IDs de Veo de este artículo pertenecen a la API de Gemini, y las páginas de Veo de arriba son para el navegador.
Crea tu primer clip hoy
Elige un prompt y ejecútalo tres veces: una en Veo 3.1, otra en Fast y otra en Lite. Mantén la misma semilla donde el formulario la ofrezca y luego pon los tres clips uno al lado del otro. Verás la diferencia de precio y velocidad en unos cinco minutos, y sabrás qué nivel merece un lugar en tu flujo de trabajo.
Un buen prompt de prueba: un barista desliza un café con leche sobre una encimera de mármol, sube vapor, jazz suave y el siseo de una máquina de café espresso, un lento acercamiento hacia la taza. Tiene un sujeto claro, un solo movimiento de cámara y un paisaje sonoro definido, así que las diferencias entre niveles aparecen en la calidad del movimiento y del audio y no en suposiciones.
PicassoIA reúne los tres en un solo sitio, así que puedes probar antes de escribir una línea de código de integración. Abre Veo 3.1, Veo 3.1 Fast o Veo 3.1 Lite, escribe la escena que has estado imaginando y mira cómo se convierte en un clip con sonido.