API do Veo 3 no n8n: fluxo de vídeo sem rosto que roda no piloto automático

Crie um fluxo de vídeo sem rosto em que o n8n lê uma planilha de temas, pede cenas a um LLM, envia cada prompt para a API do Veo 3, consulta o andamento da renderização longa, adiciona narração e publica o short finalizado. Inclui configurações de nós, regras de nova tentativa e controle de custos.

API do Veo 3 no n8n: fluxo de vídeo sem rosto que roda no piloto automático
Cristian Da Conceicao
Fundador do Picasso IA

A maioria dos canais sem rosto trava no mesmo ponto: as imagens. Roteiros são rápidos de escrever e uma voz sintética custa quase nada, mas encontrar quarenta segundos de vídeo convincente para cada publicação consome a semana inteira. Conectar a API do Veo 3 ao n8n elimina esse gargalo. Uma linha de planilha vira roteiro, o roteiro vira cenas de oito segundos, as cenas viram clipes com som já incluído, e um vídeo vertical finalizado entra na sua fila de publicação enquanto você dorme.

Este passo a passo monta esse fluxo de vídeo sem rosto nó a nó. Você verá quais nós do n8n fazem o trabalho pesado, como lidar com as respostas assíncronas e lentas do Veo, onde o dinheiro escapa e como testar prompts no Veo 3 na Picasso IA antes de fixá-los em uma automação.

Por que o Veo 3 combina com canais sem rosto

Um canal sem rosto vive de volume e de consistência. O público volta por causa de um formato, não de um apresentador, então a linha de produção importa mais do que qualquer clipe isolado. É exatamente o tipo de problema que a automação de fluxos resolve bem: as mesmas etapas, na mesma ordem, com um tema diferente a cada execução.

O Veo 3 se encaixa nessa linha por um motivo prático. É um modelo de texto para vídeo que renderiza imagem e som juntos a partir de um único prompt, e também aceita uma imagem fixa como quadro inicial, para que você mantenha um mesmo visual em todas as cenas de um episódio.

Bons nichos para esse formato incluem explicações de viagem e natureza, teasers de comida e receitas, histórias históricas com imagens atmosféricas, vitrines de produtos e loops ambientes para sono ou foco. Todos dependem de objetos, lugares e mãos, e não de um apresentador falando para a câmera, e é isso que mantém o formato sem rosto.

O áudio nativo elimina um ramo

Pipelines mais antigos tinham três ramos: vídeo, música e efeitos sonoros. O Veo 3 gera som ambiente, efeitos e falas dentro do próprio clipe. Para uma explicação sobre natureza, uma montagem de comida de rua ou um teaser de produto, isso pode ser a trilha final. Você só adiciona uma narração separada quando precisa de um texto exato ou de um mesmo narrador em toda a série.

O que um vídeo sem rosto realmente precisa

Antes de abrir o n8n, escreva o resultado que você quer. Um vídeo típico de formato curto sem rosto precisa de:

  • Um gancho nos primeiros dois segundos, geralmente uma imagem marcante, não uma frase
  • Quatro a seis cenas, cada uma curta o bastante para caber em um clipe do Veo
  • Enquadramento vertical em 9:16 para Shorts, Reels e TikTok
  • Uma voz de narrador ou uma trilha musical, nunca as duas disputando espaço
  • Título, descrição e tags prontos para a etapa de publicação

💡 Dica: Defina primeiro a quantidade de cenas. Cada cena extra adiciona mais uma chamada à API, mais uma espera e mais uma chance de algo falhar.

Fluxograma desenhado à mão em papel quadriculado planejando um fluxo automatizado de vídeo sem rosto

O fluxo de trabalho em resumo

O pipeline inteiro tem dez nós. Nenhum deles é exótico, e ele roda no n8n Cloud ou em uma instalação própria, com uma exceção explicada na etapa de montagem.

EtapaNó do n8nFunção
1Schedule TriggerDispara uma vez por dia em um horário fixo
2Google SheetsLê a próxima linha de tema não usada
3HTTP Request ou AI AgentPede a um LLM uma lista de cenas em JSON
4CodeTransforma cada cena em um prompt do Veo
5HTTP RequestEnvia o prompt para o endpoint do Veo 3
6Wait + IFConsulta até a renderização terminar
7HTTP RequestBaixa o MP4 finalizado
8Execute CommandJunta os clipes e adiciona a narração
9YouTubePublica o vídeo final
10Google SheetsRegistra status, link e custo

A ordem importa mais do que a escolha dos nós. Monte de cima para baixo, execute cada nó uma vez com dados de teste fixados e só então conecte o próximo. Um prompt de cena com defeito é muito mais barato de pegar na etapa quatro do que depois de três clipes pagos.

Monte os nós de gatilho e de roteiro

Schedule Trigger e planilha de temas

Comece com um Schedule Trigger configurado para uma execução por dia. Em seguida, adicione um nó Google Sheets que lê a primeira linha em que a coluna de status está vazia. Mantenha as colunas simples: tema, tom, status, URL do vídeo, custo. Essa planilha vira seu calendário de conteúdo, sua fila e seu registro de auditoria ao mesmo tempo.

Close de mãos digitando em uma mesa enquanto os primeiros nós de uma automação são montados

Peça ao LLM as cenas

Adicione a etapa de escrita. O caminho mais simples é um nó HTTP Request, ou o nó AI Agent do n8n, apontado para um modelo de chat como o Claude Sonnet 5, o Gemini 3.5 Flash ou o GPT 5.4. Peça um JSON estrito: um array de cenas, cada uma com uma descrição visual, um movimento de câmera e uma linha de nota sonora.

A saída estruturada importa aqui. Se o modelo devolver um texto solto, seu nó Code vai quebrar na terceira execução, geralmente às duas da manhã.

Roteirista em uma mesa em pé, em um loft iluminado, redigindo um roteiro de vídeo em um notebook

Transforme cada cena em um prompt

Um nó Code percorre as cenas e monta o prompt final de cada uma. Um prompt forte para o Veo segue sempre a mesma ordem:

  1. Sujeito e o que ele está fazendo
  2. Cenário e hora do dia
  3. Movimento de câmera e sensação da lente
  4. Luz e cor
  5. Som que você quer no clipe

Adicione uma linha de estilo fixa a cada cena, como "luz natural, câmera na mão, aspecto de filme 35mm", para que os clipes combinem quando forem unidos. Acrescente um prompt negativo que impeça textos sobrepostos, marcas d’água e logotipos.

Aqui está um exemplo pronto para uma explicação sobre produção de café: As mãos marcadas pelo tempo de um agricultor colhem cerejas vermelhas em uma plantação íngreme ao nascer do sol, aproximação lenta de câmera na altura da cintura, névoa subindo entre as fileiras, contraluz quente, folhas farfalhando suavemente e cantos de pássaros ao longe. Luz natural, câmera na mão, aspecto de filme 35mm. Repare que nenhum rosto é pedido. Mãos, paisagens e objetos mantêm o formato sem rosto, e também evitam o problema comum de uma pessoa cujo rosto muda de uma cena para a outra.

Chame a API do Veo 3 a partir do n8n

Este é o coração do fluxo, e ele se comporta de forma diferente de uma chamada de API comum.

Configure o nó HTTP Request

O Veo é disponibilizado pela API Gemini do Google como uma operação de longa duração. Sua primeira requisição não devolve um vídeo. Ela devolve um nome de operação que você consulta depois. Configure o nó assim:

  • Método: POST
  • URL: https://generativelanguage.googleapis.com/v1beta/models/veo-3.0-generate-001:predictLongRunning
  • Autenticação: uma credencial Header Auth guardada no cofre de credenciais do n8n, nunca colada no próprio nó
  • Tipo de corpo: JSON

💡 Dica: Os IDs dos modelos mudam entre as versões de prévia e as estáveis. Confirme o ID exato na documentação atual do Veo do Google antes de publicar o fluxo.

Envie um corpo com este formato:

{
  "instances": [
    { "prompt": {{ JSON.stringify($json.veoPrompt) }} }
  ],
  "parameters": {
    "aspectRatio": "9:16",
    "resolution": "720p",
    "negativePrompt": "text overlay, watermark, logo, subtitles"
  }
}

Envolver o prompt em JSON.stringify impede que uma aspa perdida dentro de uma cena quebre a requisição. Os clipes voltam com oito segundos no endpoint do Google, e a resolução 1080p está vinculada à saída em widescreen, então verifique qual resolução a proporção escolhida suporta antes de optar por um formato vertical.

Consulte com Wait e IF

A resposta contém um campo name. Armazene-o e monte um pequeno loop:

  1. Um nó Wait pausa por 60 segundos.
  2. Um nó HTTP Request envia um GET para https://generativelanguage.googleapis.com/v1beta/ seguido do nome armazenado.
  3. Um nó IF verifica se done é verdadeiro.
  4. Se for falso, o fluxo volta para um Wait mais curto, de 20 segundos. Se for verdadeiro, o fluxo segue em frente.

Na página do Veo 3 na PicassoIA, as renderizações de exemplo terminaram em cerca de 68 a 145 segundos. Trate isso como uma estimativa inicial para os seus atrasos. Com uma espera inicial de 60 segundos e consultas a cada 20 segundos, a maioria das renderizações se resolve em quatro ou cinco verificações.

Monitor de um desenvolvedor exibindo uma resposta JSON de uma requisição de geração de vídeo

Adicione um contador dentro do loop. Um nó Code incrementa o número de tentativas, e um segundo nó IF interrompe a execução após quinze verificações. Sem esse limite, uma única renderização travada pode girar para sempre e encher o histórico de execuções.

Baixe antes que o arquivo desapareça

Quando done se tornar verdadeiro, o endereço do vídeo fica dentro da resposta, em generateVideoResponse.generatedSamples. Adicione mais um nó HTTP Request, defina o formato de resposta como File, envie a mesma credencial e capture os dados binários. O Google mantém os arquivos gerados apenas por um curto período, então envie o MP4 para o seu próprio armazenamento (S3, R2 ou Drive) já no nó seguinte. Nunca guarde o link do Google na sua planilha presumindo que ele ainda vai funcionar na semana seguinte.

Ampulheta vermelha de areia sobre uma mesa de madeira clara, representando a espera enquanto a renderização termina

Adicione voz e monte o vídeo

Quando o áudio nativo basta

Teste uma cena com a faixa embutida antes de adicionar qualquer coisa. Se o som ambiente funcionar e nenhuma fala for necessária, pule o ramo de voz por completo. Cada ramo que você corta é uma coisa a menos que pode falhar durante a noite.

Adicione um narrador com texto para fala

Para formatos narrados, envie o roteiro a um modelo de fala. O ElevenLabs v3 cuida de leituras expressivas, o Speech 2.8 HD da MiniMax entrega narração de estúdio limpa, e o Gemini 3.1 Flash TTS é a escolha quando você precisa de muitos idiomas. Cada um devolve um arquivo de áudio que você pode salvar junto aos clipes.

💡 Dica: Adicione "sem diálogos" ao prompt do Veo quando planejar colocar um narrador por cima, para que as vozes do próprio clipe nunca disputem com a sua.

Microfone de condensador com filtro pop dentro de uma pequena cabine caseira de locução

Una as cenas

Unir clipes é trabalho do FFmpeg dentro de um nó Execute Command. Um comando básico lê uma lista de cenas, aplica a narração por cima e grava um único arquivo:

ffmpeg -f concat -safe 0 -i scenes.txt -i narration.mp3 \
  -map 0:v -map 1:a -c:v libx264 -c:a aac -shortest episode.mp4

Aqui está a pegadinha. O nó Execute Command funciona apenas no n8n de instalação própria. No n8n Cloud, envie as URLs dos clipes para um serviço externo de renderização por meio de um nó HTTP Request. De qualquer forma, o resultado é um MP4 por episódio, pronto para a etapa de publicação.

Editor de vídeo em uma mesa com duas telas trabalhando em uma linha do tempo de múltiplas trilhas com clipes curtos

Publique e acompanhe o custo

Envie para Shorts, Reels e TikTok

O n8n traz um nó YouTube que envia um arquivo binário com título, descrição e status de privacidade. Para outras plataformas, chame a API oficial de publicação de cada uma pelo nó HTTP Request, ou use um serviço de agendamento que ofereça um webhook. Defina a privacidade como privada nas primeiras execuções e revise cada vídeo manualmente até confiar no resultado.

Mãos segurando um smartphone que reproduz um vídeo curto vertical em uma mesa de café iluminada pelo sol

Registre cada execução na planilha

Grave de volta o status, a URL final do vídeo, o número de tentativas de renderização, a quantidade de cenas e o custo estimado. O Google cobra pelo uso do Veo por segundo de vídeo gerado, e as tarifas mudaram mais de uma vez desde o lançamento, então guarde o preço por segundo em uma variável do n8n ou em uma célula da planilha, em vez de fixá-lo em seis nós. Com oito segundos por cena e cinco cenas, um único episódio representa 40 segundos cobrados antes de contar qualquer nova tentativa.

Regras de nova tentativa que protegem o orçamento

Falhas são normais na geração de vídeo, então defina sua política com antecedência:

  • Repita uma renderização com falha uma vez, com o mesmo prompt
  • Em uma segunda falha, peça ao LLM que reescreva o prompt e tente mais uma vez
  • Depois disso, marque a linha como "precisa de revisão" e pare
  • Adicione um fluxo com Error Trigger que avise você por e-mail ou chat
  • Limite as execuções diárias para que um bug de loop não esgote seu saldo

Registro impresso de execuções com linhas com falha circuladas em caneta vermelha, ao lado de uma calculadora e faturas

Teste prompts com o Veo 3 na PicassoIA

Antes de gastar dinheiro com a API, prototipe cada prompt de cena manualmente. O Veo 3 na PicassoIA aceita um prompt, uma resolução, uma proporção, uma imagem inicial opcional, um prompt negativo e um seed. Esta é a rotina:

  1. Abra a página do Veo 3 e entre na sua conta.
  2. Cole um prompt de cena escrito na mesma ordem que o seu nó Code usa.
  3. Defina a resolução como 720p para os testes e troque para 1080p somente na renderização final.
  4. Escolha 9:16 para shorts verticais ou 16:9 para widescreen.
  5. Opcionalmente, envie uma imagem inicial. Quadros ideais têm 1280x720.
  6. Adicione um prompt negativo como "texto, marca d’água, logotipo".
  7. Quando um visual funcionar, fixe o seed para que as novas execuções o reproduzam.
  8. Gere e aguarde. As renderizações de exemplo na página levaram de cerca de um a dois minutos e meio.

Outros modelos de vídeo valem a pena ser testados com o mesmo prompt:

ModeloIndicado para
Veo 3 FastRascunhos mais rápidos do mesmo visual
Veo 3.1A geração mais nova em até 1080p
Veo 3.1 FastVelocidade com o modelo mais novo
Veo 3.1 LiteTestes mais baratos
Seedance 2.5 LiteVídeo com áudio, de até 10 segundos
PicassoIA VideoTexto ou imagem para vídeo em um só lugar

💡 Dica: A PicassoIA também mantém uma API para desenvolvedores em https://api.picassoia.com/v1, com endpoints no estilo Replicate: um POST para /v1/models/{owner}/{name}/predictions, depois um GET em /v1/predictions/{id} até o trabalho terminar. Até a data desta redação, ela oferece o PicassoIA Video e o Seedance 2.5 Lite para vídeo e permite cinco previsões simultâneas por conta. O Veo 3 não está nessa lista, por isso o fluxo acima aponta para o endpoint do Google. O padrão de criar e depois consultar é idêntico, então o mesmo loop de Wait e IF funciona para os dois.

Faça seu primeiro clipe hoje

Você não precisa do pipeline completo de dez nós para ver se essa ideia funciona para o seu nicho. Escolha um tema, escreva cinco prompts de cena na ordem da rotina acima e rode-os na Picasso IA. Compare um rascunho em 720p com uma renderização em 1080p, teste uma versão vertical e uma em widescreen, e anote quais prompts se sustentam de uma cena para outra.

Quando tiver três prompts em que confia, copie-os para o seu nó Code e deixe o n8n assumir o trabalho repetitivo. Comece pequeno, registre tudo e adicione um ramo por vez. Abra a Picasso IA, rode sua primeira cena e veja até onde um bom prompt pode levar um canal sem rosto.

Compartilhe este artigo

Escolha seu idioma