Nome da API do Veo 3.1: IDs de modelo para Veo 3.1, Fast e Lite
Os três IDs de modelo do Veo 3.1 na API do Gemini, lado a lado: padrão, Fast e Lite. Veja quais resoluções e durações de clipe cada um permite, quanto custa cada segundo de vídeo, como chamá-los em Python e como rodá-los pelo navegador.
Você cola o nome de um modelo no seu script, executa e recebe um erro em vez de um vídeo. Com o Veo 3.1 isso acontece com mais frequência do que deveria, porque o nome no anúncio de lançamento, o nome na API do Gemini e o nome em uma plataforma de terceiros são três strings diferentes. Esta página lista os IDs exatos do Veo 3.1, Veo 3.1 Fast e Veo 3.1 Lite, o que cada um faz, quanto cada um custa por segundo e como chamá-los sem adivinhar.
Em resumo: na API do Gemini, os três nomes são veo-3.1-generate-preview, veo-3.1-fast-generate-preview e veo-3.1-lite-generate-preview. Tudo o que vem abaixo explica por que eles têm essa forma, qual deles serve para o seu trabalho e como rodar os mesmos modelos no PicassoIA quando você preferir clicar a programar. Se uma requisição falhar logo de cara, compare sua string com a tabela abaixo antes de mexer em qualquer outra coisa, porque um erro de um único caractere é fácil de cometer e difícil de notar em um script longo.
Os três IDs de modelo
A documentação da API do Gemini, do Google, lista estes códigos para a família Veo 3.1. Copie-os exatamente, incluindo o final -preview.
💡 Dica: os IDs são strings literais. veo-3.1, veo3.1 e veo-3-1-fast não são nenhum dos três códigos acima, então uma requisição que os usa está pedindo um modelo que a lista do Google não contém.
Veo 3.1 padrão
veo-3.1-generate-preview fica no topo da família. Segundo a tabela de propriedades do Google, ele aceita texto ou imagem como entrada, devolve vídeo com áudio gerado nativamente e oferece saída em 720p, 1080p e 4k. Os clipes têm 4, 6 ou 8 segundos, e 1080p e 4k ficam limitados a 8 segundos. Escolha-o quando o clipe for a entrega final e o orçamento permitir.
Veo 3.1 Fast
veo-3.1-fast-generate-preview compartilha as mesmas linhas de entrada, saída, resolução e duração do modelo padrão na tabela do Google. O que muda é a contrapartida: um preço por segundo menor e esperas mais curtas. Nas gerações de exemplo publicadas na sua página no PicassoIA, os clipes Fast ficaram prontos em cerca de 45 a 59 segundos, contra 72 a 114 segundos nos exemplos da página do Veo 3.1 padrão.
Veo 3.1 Lite
veo-3.1-lite-generate-preview é o nível mais barato. Ele aceita 720p e 1080p (somente em 8 segundos), não tem saída em 4k, e a documentação do Google diz que a extensão de vídeo não está disponível para ele. Os exemplos da página do Veo 3.1 Lite ficaram prontos em cerca de 37 a 42 segundos. Pense nele como o nível de volume: muitos rascunhos, clipes para redes sociais e loops de fundo.
De onde vêm os nomes
Entendendo o padrão
Todo ID segue uma mesma forma: versão, nível opcional, a palavra generate e, por fim, a etapa de lançamento. Assim, veo-3.1-fast-generate-preview se lê como Veo 3.1, nível Fast, generate, etapa preview.
Os modelos Veo 3 mais antigos usam um sufixo de etapa diferente. veo-3.0-generate-001 e veo-3.0-fast-generate-001 estão listados como estáveis, com clipes de 8 segundos em 720p ou 1080p. Se você quiser esses no PicassoIA, eles são o Veo 3 e o Veo 3 Fast.
Preview significa que o Google ainda pode mudar o comportamento, os limites ou o preço. Guarde a string em uma única constante de configuração, assim uma única edição atualiza todo o seu projeto no dia em que um nome mudar.
Estável ou preview? Se o seu produto não pode tolerar que um modelo seja renomeado ou tenha o preço alterado, o par estável Veo 3 é a base mais segura, desde que clipes de 8 segundos em 720p ou 1080p bastem. Se você precisa de durações de 4, 6 ou 8 segundos, do nível Lite mais barato ou da saída em 4k, está em território de preview e deve se preparar para mudanças. Registre a string do modelo ao lado de cada arquivo gerado, para poder reproduzir ou auditar um resultado meses depois.
Nomes em outras plataformas
Nunca cole uma string da API do Gemini em outra plataforma. O PicassoIA cataloga esses modelos sob o dono google, com nomes que deixam de lado as palavras generate e preview, e slugs de página sem os pontos.
Onde
Veo 3.1
Fast
Lite
API do Gemini
veo-3.1-generate-preview
veo-3.1-fast-generate-preview
veo-3.1-lite-generate-preview
Nome do modelo no PicassoIA
google/veo-3.1
google/veo-3.1-fast
google/veo-3.1-lite
Slug da página no PicassoIA
google-veo-31
google-veo-31-fast
google-veo-31-lite
A regra prática: uma ferramenta que conversa com a API do Gemini quer veo-3.1-generate-preview, enquanto uma ferramenta ou catálogo que trabalha com pares de dono e nome quer google/veo-3.1. Misturar os dois é um jeito fácil de acabar pedindo um modelo que não existe.
O Vertex AI do Google Cloud mantém a própria listagem de modelos. Leia o ID nesse console em vez de presumir que ele coincide com a string da API do Gemini.
Especificações lado a lado
Todos os números abaixo vêm da documentação da API do Gemini, do Google, para o Veo.
Propriedade
Veo 3.1
Veo 3.1 Fast
Veo 3.1 Lite
Veo 3 e Fast
Entrada
Texto, imagem
Texto, imagem
Texto, imagem
Texto, imagem
Saída
Vídeo com áudio
Vídeo com áudio
Vídeo com áudio
Vídeo com áudio
Resolução
720p, 1080p, 4k
720p, 1080p, 4k
720p, 1080p
720p, 1080p
Duração
4, 6 ou 8 s
4, 6 ou 8 s
4, 6 ou 8 s
8 s
Status
Preview
Preview
Preview
Estável
A regra do 1080p
O Google vincula 1080p (e 4k nos modelos que o têm) a clipes de 8 segundos, e a versão Lite no PicassoIA repete a mesma regra: a duração precisa ser 8 quando você escolhe 1080p. Trate resolução e duração como um par. Um clipe de 4 ou 6 segundos significa 720p.
O que o Lite deixa de fora
Além do 4k e da extensão de vídeo, a versão Lite no PicassoIA não tem campo de prompt negativo, chave de áudio nem imagens de referência. O formulário do modelo padrão tem os três, e o Fast mantém o prompt negativo e a chave de áudio. Se o seu pipeline depende de imagens de referência para manter um personagem estável, o Lite é o nível errado.
Quanto custa cada chamada
O Google cobra o Veo por segundo de vídeo gerado. Estes são os preços com áudio na página de preços dele quando este texto foi escrito, além do custo de um clipe de 8 segundos.
Modelo
720p por segundo
1080p por segundo
4k por segundo
Clipe de 8 s em 1080p
Veo 3.1
US$ 0,40
US$ 0,40
US$ 0,60
US$ 3,20
Veo 3.1 Fast
US$ 0,10
US$ 0,12
US$ 0,30
US$ 0,96
Veo 3.1 Lite
US$ 0,05
US$ 0,08
Não suportado
US$ 0,64
💡 Confira antes de orçar: estes são modelos em preview, e os preços de preview podem mudar. O Google também informa que você só é cobrado quando um vídeo é gerado com sucesso.
Rascunho barato, acabamento caro
Faça as contas com um lote real. Dez rascunhos de 8 segundos no Lite em 720p custam 10 x US$ 0,40 = US$ 4,00. Três refinamentos no Fast em 1080p custam 3 x US$ 0,96 = US$ 2,88. Uma versão final no padrão em 1080p custa US$ 3,20. Total: US$ 10,08. Gerar os catorze clipes no padrão em 1080p custaria 14 x US$ 3,20 = US$ 44,80 pelo mesmo número de gerações.
Rascunhos mais curtos economizam ainda mais. Um clipe de 4 segundos é permitido em 720p, então um rascunho no Lite custa 4 x US$ 0,05 = US$ 0,20, um rascunho no Fast custa US$ 0,40 e um rascunho no padrão custa US$ 1,60. Defina o movimento de câmera e o som em rascunhos de 4 segundos e só então gaste os 8 segundos quando o prompt funcionar.
No PicassoIA você gera pelo navegador, então não há um medidor por segundo no seu próprio código para acompanhar. Os limites dependem do seu plano, então confira antes de uma execução grande.
Uma chamada em Python que funciona
A documentação do Google mostra o padrão abaixo para o modelo padrão. Ele usa o SDK google-genai, inicia uma operação de longa duração e consulta essa operação até o vídeo estar pronto. O cliente lê sua credencial do Gemini a partir do ambiente, então configure-a como o Google AI Studio descreve antes de executar.
import time
from google import genai
from google.genai import types
client = genai.Client()
prompt = "A slow dolly shot along a rainy street at dusk, a street musician plays saxophone, rain and distant traffic in the audio"
operation = client.models.generate_videos(
model="veo-3.1-generate-preview",
prompt=prompt,
)
while not operation.done:
print("Waiting for video generation to finish...")
time.sleep(10)
operation = client.operations.get(operation)
generated_video = operation.response.generated_videos[0]
client.files.download(file=generated_video.video, destination="output.mp4")
Trocar de nível muda um único argumento. Guarde os três nomes em um dicionário e passe o que você precisa:
A chamada devolve uma operação, não um vídeo. Seu laço verifica operation.done a cada 10 segundos e depois baixa o arquivo. Conte com esperas de um a dois minutos no modelo padrão e menos no Fast e no Lite, com base nos tempos de exemplo acima. Não reenvie enquanto uma operação ainda estiver em execução, senão você gera (e paga por) um segundo clipe.
Erros que desperdiçam dinheiro
Sufixo ausente.veo-3.1-generate sem -preview não é um código listado.
4k no Lite. Esse nível não oferece.
1080p com um clipe de 6 segundos. Defina 8 segundos ou volte para 720p.
Estender um clipe do Lite. O Google diz que a extensão não está disponível para o Lite.
Espalhar strings pelo código. Se você fixa o ID em dez arquivos, uma renomeação custa uma tarde.
Antes de enfileirar um lote, percorra esta checklist curta:
A string do modelo corresponde a um dos três códigos da primeira tabela, caractere por caractere.
Resolução e duração formam um par válido: 1080p significa 8 segundos.
O nível escolhido oferece o que você precisa: 4k, extensão e imagens de referência não estão no Lite.
Você registrou a string do modelo e o prompt ao lado de cada arquivo de saída.
Você multiplicou o preço por segundo pelo número de clipes antes de clicar em executar.
Qual modelo serve para o seu trabalho
Trabalho
Melhor nível
Por quê
Testes de prompt e storyboards
Fast
Preço baixo, entrega rápida
Clipe final de destaque ou entrega em 4k
Veo 3.1 padrão
Maior teto de resolução
Clipes verticais diários para redes sociais
Lite
Mais barato por segundo
Manter um mesmo assunto estável entre cenas
Veo 3.1 padrão
Imagens de referência no PicassoIA
Fast para iterar
A maioria dos prompts precisa de três ou quatro reescritas até que o movimento de câmera e o som fiquem onde você quer. Faça essas reescritas no Veo 3.1 Fast e depois leve o prompt vencedor para o modelo padrão.
Como todos os níveis devolvem áudio nativo, escreva o som no prompt. Os próprios prompts de exemplo do PicassoIA fazem exatamente isso: um apito de trem e o ruído ambiente de uma estação, jazz suave com chuva batendo na vidraça, uma linha de diálogo falado entre aspas. Um prompt que nomeia o som dá ao modelo algo em torno do qual construir a trilha, e você percebe a diferença entre os rascunhos rapidamente.
Padrão para os acabamentos
Quando um clipe vai aparecer em uma landing page, em uma apresentação para cliente ou em uma tela grande, o custo extra do Veo 3.1 é fácil de justificar. Ele também é o único nível desta família com imagens de referência no PicassoIA, e divide a linha de 4k com o Fast na tabela do Google.
Lite para volume
O Veo 3.1 Lite serve para qualquer fluxo de trabalho em que você precise de dezenas de clipes curtos: loops de produto, posts verticais, imagens de fundo para um podcast. Mude a proporção para 9:16 e defina 720p para o resultado mais barato.
Como usar o Veo 3.1 no PicassoIA
Sem código, sem credenciais, mesma família de modelos. Este é o fluxo na página do Veo 3.1:
Escreva o prompt. Este é o único campo obrigatório. Descreva o assunto, o movimento de câmera, a luz e o som que você quer ouvir.
Defina a duração. Escolha 4, 6 ou 8 segundos. O padrão é 8.
Defina resolução e proporção. Escolha 720p ou 1080p (o padrão é 1080p) e 16:9 ou 9:16.
Mantenha o áudio ligado. A opção de áudio vem ativada por padrão. Adicione um prompt negativo para tudo o que quiser deixar de fora.
Gere e baixe. Aguarde o clipe e salve o arquivo.
Quadros e imagens de referência
Adicione uma imagem de entrada para começar pelo seu próprio primeiro quadro. Adicione também um último quadro e o modelo cria uma transição entre os dois. As imagens ideais são 16:9 ou 9:16 em 1280x720 ou 720x1280, correspondendo à proporção que você escolher.
Para manter um assunto consistente, envie de uma a três imagens de referência. Isso funciona somente no modelo padrão, e apenas com 16:9 e 8 segundos. Se você fornecer imagens de referência, o último quadro é ignorado, então escolha uma abordagem por clipe.
Fast e Lite no PicassoIA
O Veo 3.1 Fast vem com 1080p por padrão e mantém o prompt negativo e a chave de áudio. O Veo 3.1 Lite vem com 720p por padrão e exige 8 segundos sempre que você escolher 1080p.
💡 Programando com o PicassoIA? Quando este texto foi escrito, a API para desenvolvedores do PicassoIA listava quatro modelos próprios, incluindo o PicassoIA Video e o Seedance 2.5 Lite, em vez dos modelos Veo do Google. Os IDs Veo deste artigo pertencem à API do Gemini, e as páginas Veo acima servem para o navegador.
Faça seu primeiro clipe hoje
Escolha um prompt e rode-o três vezes: uma no Veo 3.1, uma no Fast e uma no Lite. Mantenha o seed igual onde o formulário oferecer, depois coloque os três clipes lado a lado. Você verá a diferença de preço e de velocidade em cerca de cinco minutos e saberá qual nível merece um lugar no seu fluxo de trabalho.
Um bom prompt de teste: um barista desliza um café com leite sobre um balcão de mármore, vapor subindo, jazz suave e o chiado de uma máquina de espresso, aproximação lenta da câmera sobre a xícara. Ele tem um assunto claro, um único movimento de câmera e uma paisagem sonora definida, então as diferenças entre os níveis aparecem na qualidade do movimento e no áudio, e não em palpites.
O PicassoIA reúne os três em um só site, então você pode testar antes de escrever uma linha de código de integração. Abra o Veo 3.1, o Veo 3.1 Fast ou o Veo 3.1 Lite, digite a cena que você vinha imaginando e veja-a virar um clipe com som.