API do Veo 3 no n8n: fluxo de vídeo sem rosto que roda no piloto automático
Crie um fluxo de vídeo sem rosto em que o n8n lê uma planilha de temas, pede cenas a um LLM, envia cada prompt para a API do Veo 3, consulta o andamento da renderização longa, adiciona narração e publica o short finalizado. Inclui configurações de nós, regras de nova tentativa e controle de custos.
A maioria dos canais sem rosto trava no mesmo ponto: as imagens. Roteiros são rápidos de escrever e uma voz sintética custa quase nada, mas encontrar quarenta segundos de vídeo convincente para cada publicação consome a semana inteira. Conectar a API do Veo 3 ao n8n elimina esse gargalo. Uma linha de planilha vira roteiro, o roteiro vira cenas de oito segundos, as cenas viram clipes com som já incluído, e um vídeo vertical finalizado entra na sua fila de publicação enquanto você dorme.
Este passo a passo monta esse fluxo de vídeo sem rosto nó a nó. Você verá quais nós do n8n fazem o trabalho pesado, como lidar com as respostas assíncronas e lentas do Veo, onde o dinheiro escapa e como testar prompts no Veo 3 na Picasso IA antes de fixá-los em uma automação.
Por que o Veo 3 combina com canais sem rosto
Um canal sem rosto vive de volume e de consistência. O público volta por causa de um formato, não de um apresentador, então a linha de produção importa mais do que qualquer clipe isolado. É exatamente o tipo de problema que a automação de fluxos resolve bem: as mesmas etapas, na mesma ordem, com um tema diferente a cada execução.
O Veo 3 se encaixa nessa linha por um motivo prático. É um modelo de texto para vídeo que renderiza imagem e som juntos a partir de um único prompt, e também aceita uma imagem fixa como quadro inicial, para que você mantenha um mesmo visual em todas as cenas de um episódio.
Bons nichos para esse formato incluem explicações de viagem e natureza, teasers de comida e receitas, histórias históricas com imagens atmosféricas, vitrines de produtos e loops ambientes para sono ou foco. Todos dependem de objetos, lugares e mãos, e não de um apresentador falando para a câmera, e é isso que mantém o formato sem rosto.
O áudio nativo elimina um ramo
Pipelines mais antigos tinham três ramos: vídeo, música e efeitos sonoros. O Veo 3 gera som ambiente, efeitos e falas dentro do próprio clipe. Para uma explicação sobre natureza, uma montagem de comida de rua ou um teaser de produto, isso pode ser a trilha final. Você só adiciona uma narração separada quando precisa de um texto exato ou de um mesmo narrador em toda a série.
O que um vídeo sem rosto realmente precisa
Antes de abrir o n8n, escreva o resultado que você quer. Um vídeo típico de formato curto sem rosto precisa de:
Um gancho nos primeiros dois segundos, geralmente uma imagem marcante, não uma frase
Quatro a seis cenas, cada uma curta o bastante para caber em um clipe do Veo
Enquadramento vertical em 9:16 para Shorts, Reels e TikTok
Uma voz de narrador ou uma trilha musical, nunca as duas disputando espaço
Título, descrição e tags prontos para a etapa de publicação
💡 Dica: Defina primeiro a quantidade de cenas. Cada cena extra adiciona mais uma chamada à API, mais uma espera e mais uma chance de algo falhar.
O fluxo de trabalho em resumo
O pipeline inteiro tem dez nós. Nenhum deles é exótico, e ele roda no n8n Cloud ou em uma instalação própria, com uma exceção explicada na etapa de montagem.
Etapa
Nó do n8n
Função
1
Schedule Trigger
Dispara uma vez por dia em um horário fixo
2
Google Sheets
Lê a próxima linha de tema não usada
3
HTTP Request ou AI Agent
Pede a um LLM uma lista de cenas em JSON
4
Code
Transforma cada cena em um prompt do Veo
5
HTTP Request
Envia o prompt para o endpoint do Veo 3
6
Wait + IF
Consulta até a renderização terminar
7
HTTP Request
Baixa o MP4 finalizado
8
Execute Command
Junta os clipes e adiciona a narração
9
YouTube
Publica o vídeo final
10
Google Sheets
Registra status, link e custo
A ordem importa mais do que a escolha dos nós. Monte de cima para baixo, execute cada nó uma vez com dados de teste fixados e só então conecte o próximo. Um prompt de cena com defeito é muito mais barato de pegar na etapa quatro do que depois de três clipes pagos.
Monte os nós de gatilho e de roteiro
Schedule Trigger e planilha de temas
Comece com um Schedule Trigger configurado para uma execução por dia. Em seguida, adicione um nó Google Sheets que lê a primeira linha em que a coluna de status está vazia. Mantenha as colunas simples: tema, tom, status, URL do vídeo, custo. Essa planilha vira seu calendário de conteúdo, sua fila e seu registro de auditoria ao mesmo tempo.
Peça ao LLM as cenas
Adicione a etapa de escrita. O caminho mais simples é um nó HTTP Request, ou o nó AI Agent do n8n, apontado para um modelo de chat como o Claude Sonnet 5, o Gemini 3.5 Flash ou o GPT 5.4. Peça um JSON estrito: um array de cenas, cada uma com uma descrição visual, um movimento de câmera e uma linha de nota sonora.
A saída estruturada importa aqui. Se o modelo devolver um texto solto, seu nó Code vai quebrar na terceira execução, geralmente às duas da manhã.
Transforme cada cena em um prompt
Um nó Code percorre as cenas e monta o prompt final de cada uma. Um prompt forte para o Veo segue sempre a mesma ordem:
Sujeito e o que ele está fazendo
Cenário e hora do dia
Movimento de câmera e sensação da lente
Luz e cor
Som que você quer no clipe
Adicione uma linha de estilo fixa a cada cena, como "luz natural, câmera na mão, aspecto de filme 35mm", para que os clipes combinem quando forem unidos. Acrescente um prompt negativo que impeça textos sobrepostos, marcas d’água e logotipos.
Aqui está um exemplo pronto para uma explicação sobre produção de café: As mãos marcadas pelo tempo de um agricultor colhem cerejas vermelhas em uma plantação íngreme ao nascer do sol, aproximação lenta de câmera na altura da cintura, névoa subindo entre as fileiras, contraluz quente, folhas farfalhando suavemente e cantos de pássaros ao longe. Luz natural, câmera na mão, aspecto de filme 35mm. Repare que nenhum rosto é pedido. Mãos, paisagens e objetos mantêm o formato sem rosto, e também evitam o problema comum de uma pessoa cujo rosto muda de uma cena para a outra.
Chame a API do Veo 3 a partir do n8n
Este é o coração do fluxo, e ele se comporta de forma diferente de uma chamada de API comum.
Configure o nó HTTP Request
O Veo é disponibilizado pela API Gemini do Google como uma operação de longa duração. Sua primeira requisição não devolve um vídeo. Ela devolve um nome de operação que você consulta depois. Configure o nó assim:
Autenticação: uma credencial Header Auth guardada no cofre de credenciais do n8n, nunca colada no próprio nó
Tipo de corpo: JSON
💡 Dica: Os IDs dos modelos mudam entre as versões de prévia e as estáveis. Confirme o ID exato na documentação atual do Veo do Google antes de publicar o fluxo.
Envolver o prompt em JSON.stringify impede que uma aspa perdida dentro de uma cena quebre a requisição. Os clipes voltam com oito segundos no endpoint do Google, e a resolução 1080p está vinculada à saída em widescreen, então verifique qual resolução a proporção escolhida suporta antes de optar por um formato vertical.
Consulte com Wait e IF
A resposta contém um campo name. Armazene-o e monte um pequeno loop:
Um nó Wait pausa por 60 segundos.
Um nó HTTP Request envia um GET para https://generativelanguage.googleapis.com/v1beta/ seguido do nome armazenado.
Um nó IF verifica se done é verdadeiro.
Se for falso, o fluxo volta para um Wait mais curto, de 20 segundos. Se for verdadeiro, o fluxo segue em frente.
Na página do Veo 3 na PicassoIA, as renderizações de exemplo terminaram em cerca de 68 a 145 segundos. Trate isso como uma estimativa inicial para os seus atrasos. Com uma espera inicial de 60 segundos e consultas a cada 20 segundos, a maioria das renderizações se resolve em quatro ou cinco verificações.
Adicione um contador dentro do loop. Um nó Code incrementa o número de tentativas, e um segundo nó IF interrompe a execução após quinze verificações. Sem esse limite, uma única renderização travada pode girar para sempre e encher o histórico de execuções.
Baixe antes que o arquivo desapareça
Quando done se tornar verdadeiro, o endereço do vídeo fica dentro da resposta, em generateVideoResponse.generatedSamples. Adicione mais um nó HTTP Request, defina o formato de resposta como File, envie a mesma credencial e capture os dados binários. O Google mantém os arquivos gerados apenas por um curto período, então envie o MP4 para o seu próprio armazenamento (S3, R2 ou Drive) já no nó seguinte. Nunca guarde o link do Google na sua planilha presumindo que ele ainda vai funcionar na semana seguinte.
Adicione voz e monte o vídeo
Quando o áudio nativo basta
Teste uma cena com a faixa embutida antes de adicionar qualquer coisa. Se o som ambiente funcionar e nenhuma fala for necessária, pule o ramo de voz por completo. Cada ramo que você corta é uma coisa a menos que pode falhar durante a noite.
Adicione um narrador com texto para fala
Para formatos narrados, envie o roteiro a um modelo de fala. O ElevenLabs v3 cuida de leituras expressivas, o Speech 2.8 HD da MiniMax entrega narração de estúdio limpa, e o Gemini 3.1 Flash TTS é a escolha quando você precisa de muitos idiomas. Cada um devolve um arquivo de áudio que você pode salvar junto aos clipes.
💡 Dica: Adicione "sem diálogos" ao prompt do Veo quando planejar colocar um narrador por cima, para que as vozes do próprio clipe nunca disputem com a sua.
Una as cenas
Unir clipes é trabalho do FFmpeg dentro de um nó Execute Command. Um comando básico lê uma lista de cenas, aplica a narração por cima e grava um único arquivo:
Aqui está a pegadinha. O nó Execute Command funciona apenas no n8n de instalação própria. No n8n Cloud, envie as URLs dos clipes para um serviço externo de renderização por meio de um nó HTTP Request. De qualquer forma, o resultado é um MP4 por episódio, pronto para a etapa de publicação.
Publique e acompanhe o custo
Envie para Shorts, Reels e TikTok
O n8n traz um nó YouTube que envia um arquivo binário com título, descrição e status de privacidade. Para outras plataformas, chame a API oficial de publicação de cada uma pelo nó HTTP Request, ou use um serviço de agendamento que ofereça um webhook. Defina a privacidade como privada nas primeiras execuções e revise cada vídeo manualmente até confiar no resultado.
Registre cada execução na planilha
Grave de volta o status, a URL final do vídeo, o número de tentativas de renderização, a quantidade de cenas e o custo estimado. O Google cobra pelo uso do Veo por segundo de vídeo gerado, e as tarifas mudaram mais de uma vez desde o lançamento, então guarde o preço por segundo em uma variável do n8n ou em uma célula da planilha, em vez de fixá-lo em seis nós. Com oito segundos por cena e cinco cenas, um único episódio representa 40 segundos cobrados antes de contar qualquer nova tentativa.
Regras de nova tentativa que protegem o orçamento
Falhas são normais na geração de vídeo, então defina sua política com antecedência:
Repita uma renderização com falha uma vez, com o mesmo prompt
Em uma segunda falha, peça ao LLM que reescreva o prompt e tente mais uma vez
Depois disso, marque a linha como "precisa de revisão" e pare
Adicione um fluxo com Error Trigger que avise você por e-mail ou chat
Limite as execuções diárias para que um bug de loop não esgote seu saldo
Teste prompts com o Veo 3 na PicassoIA
Antes de gastar dinheiro com a API, prototipe cada prompt de cena manualmente. O Veo 3 na PicassoIA aceita um prompt, uma resolução, uma proporção, uma imagem inicial opcional, um prompt negativo e um seed. Esta é a rotina:
Abra a página do Veo 3 e entre na sua conta.
Cole um prompt de cena escrito na mesma ordem que o seu nó Code usa.
Defina a resolução como 720p para os testes e troque para 1080p somente na renderização final.
Escolha 9:16 para shorts verticais ou 16:9 para widescreen.
Opcionalmente, envie uma imagem inicial. Quadros ideais têm 1280x720.
Adicione um prompt negativo como "texto, marca d’água, logotipo".
Quando um visual funcionar, fixe o seed para que as novas execuções o reproduzam.
Gere e aguarde. As renderizações de exemplo na página levaram de cerca de um a dois minutos e meio.
Outros modelos de vídeo valem a pena ser testados com o mesmo prompt:
💡 Dica: A PicassoIA também mantém uma API para desenvolvedores em https://api.picassoia.com/v1, com endpoints no estilo Replicate: um POST para /v1/models/{owner}/{name}/predictions, depois um GET em /v1/predictions/{id} até o trabalho terminar. Até a data desta redação, ela oferece o PicassoIA Video e o Seedance 2.5 Lite para vídeo e permite cinco previsões simultâneas por conta. O Veo 3 não está nessa lista, por isso o fluxo acima aponta para o endpoint do Google. O padrão de criar e depois consultar é idêntico, então o mesmo loop de Wait e IF funciona para os dois.
Faça seu primeiro clipe hoje
Você não precisa do pipeline completo de dez nós para ver se essa ideia funciona para o seu nicho. Escolha um tema, escreva cinco prompts de cena na ordem da rotina acima e rode-os na Picasso IA. Compare um rascunho em 720p com uma renderização em 1080p, teste uma versão vertical e uma em widescreen, e anote quais prompts se sustentam de uma cena para outra.
Quando tiver três prompts em que confia, copie-os para o seu nó Code e deixe o n8n assumir o trabalho repetitivo. Comece pequeno, registre tudo e adicione um ramo por vez. Abra a Picasso IA, rode sua primeira cena e veja até onde um bom prompt pode levar um canal sem rosto.