Servidor MCP do Veo 3.1: gere vídeos Veo no Claude e no Gemini

Um servidor MCP do Veo 3.1 permite que o Claude e o Gemini iniciem renderizações de vídeo do Google, consultem o status do trabalho e salvem o MP4 para você. Veja os nomes reais das ferramentas, os blocos de configuração para Claude Desktop, Claude Code e Gemini CLI, os preços por segundo e padrões de prompt que geram clipes melhores.

Servidor MCP do Veo 3.1: gere vídeos Veo no Claude e no Gemini
Cristian Da Conceicao
Fundador do Picasso IA

Digitar uma frase no Claude e receber de volta um vídeo pronto, com som, já não é um truque de laboratório. Com um servidor MCP do Veo 3.1, isso vira uma chamada de ferramenta comum: seu cliente envia o prompt para o modelo de vídeo do Google, espera o clipe ser renderizado e salva o MP4 em uma pasta que você escolheu. O problema é que nada funciona de imediato. Você escolhe um servidor, conecta-o ao Claude ou ao Gemini e confere a cobrança antes da primeira renderização consumir seu orçamento.

Este artigo percorre essa configuração com nomes reais de ferramentas, blocos de configuração reais e preços reais por segundo, e depois mostra a alternativa sem configuração na PicassoIA. Tudo o que se refere a servidores de terceiros vem dos READMEs públicos e das listagens deles, então leia como uma lista de leitura, não como um relatório de testes.

Mãos digitando em um notebook com um quadro pausado de vídeo do oceano na tela

O que um servidor MCP do Veo faz

MCP, o Model Context Protocol, é o padrão aberto que permite a um cliente de IA chamar ferramentas externas. Um servidor MCP do Veo é um pequeno programa que expõe a geração de vídeo como um conjunto de ferramentas. Seu cliente o inicia como um processo local, lê a lista de ferramentas e chama essas ferramentas sempre que você pede um clipe.

Por que não chamar a API do Gemini diretamente? Você pode, e um script curto em Python faz o trabalho. Um servidor MCP se justifica quando você quer que a conversa conduza o trabalho: o Claude elabora a lista de planos, escolhe as configurações, inicia a renderização, acompanha o andamento e informa onde o arquivo foi salvo, tudo na mesma conversa.

Um mini computador pequeno, sem ventilador, sobre uma prateleira de carvalho com um único cabo ethernet

As três peças em movimento

Toda configuração tem as mesmas três camadas, qualquer que seja o servidor escolhido.

PeçaExemploFunção
ClienteClaude Desktop, Claude Code, Gemini CLIRecebe seu pedido e decide qual ferramenta chamar
ServidorUm pacote Python iniciado com uvxTransforma as chamadas de ferramenta em requisições à API do Gemini
ModeloVeo 3.1Renderiza o vídeo e o áudio dele

O servidor guarda sua credencial do Google, então é a peça que merece mais atenção.

Por que o vídeo exige ferramentas assíncronas

Uma resposta de texto chega em segundos. Um vídeo, não. O README de um servidor cita tempos de renderização de 11 segundos a 6 minutos, dependendo do prompt, e outro inicia o trabalho em segundo plano, devolve um ID de tarefa e pede que o cliente consulte o status a cada 15 a 20 segundos. Esse padrão importa porque os clientes de chat desistem de chamadas de ferramenta que demoram demais.

💡 Se um servidor bloquear até o vídeo terminar, espere timeouts em renderizações longas. Prefira servidores com uma ferramenta que inicia o trabalho e outra, separada, que verifica o status.

Servidores da comunidade e suas ferramentas

O Google disponibiliza o Veo pela API do Gemini, e a comunidade o envolveu em vários servidores MCP. Nenhum deles é feito pelo Google ou pela PicassoIA. Os detalhes abaixo vêm do servidor alohc no GitHub, da listagem Gemini Media MCP, do visualgen mcp e do mcp-veo da AceDataCloud.

Um desenvolvedor de barba lendo código em um monitor largo num apartamento de estúdio ao entardecer

Ferramentas que você vai encontrar

ServidorFerramentasLimites
alohc veo-mcp-servergenerate_video, animate_image, extend_video_clip, generate_video_with_style, list_veo_models4, 6 ou 8 segundos, 720p ou 1080p, 16:9 ou 9:16
Gemini Media MCPveo_generate_video, veo_image_to_video, veo_interpolate_video, veo_extend_video, veo_check_job, veo_list_jobs e três ferramentas utilitárias720p, 1080p ou 4K, lotes de 1 a 4 vídeos
visualgen mcpUm gerador de imagens mais o Veo 3.1 nas versões lite, fast e standard720p até 4K, imagem para vídeo opcional
mcp-veo (AceDataCloud)Texto para vídeo, imagem para vídeo, upscaling para 1080p, acompanhamento de tarefasRoda pela API da AceDataCloud, não diretamente pelo Google

Três tipos de ferramenta se repetem em todos os lugares: texto para vídeo, imagem para vídeo e extensão. A extensão acrescenta cerca de 7 segundos a um clipe existente, mas um README a limita a 720p e a 148 segundos no total, e o Veo 3.1 Lite não oferece extensão de jeito nenhum.

O modelo padrão do servidor alohc é veo-3.1-generate-preview, e o servidor Gemini Media MCP oferece uma versão standard e uma versão fast. Quando um servidor deixa você escolher o modelo pelo nome, escreva essa escolha no seu prompt para que o cliente não precise adivinhar.

Escolha um que você possa auditar

Esses programas rodam na sua máquina, com sua credencial do Google no ambiente. Antes de instalar um deles:

  • Leia o código-fonte, já que cada um é curto o bastante para ser examinado rapidamente.
  • Fixe uma versão em vez de acompanhar sempre a versão mais recente.
  • Crie uma credencial do Google exclusiva para ele, para que você possa revogá-la sem quebrar mais nada.
  • Configure um alerta de orçamento na conta de faturamento, porque um loop descontrolado é cobrado por segundo de vídeo.

Conecte o Veo ao Claude

O Claude acessa servidores MCP de duas formas: o Claude Desktop por um arquivo de configuração em JSON, e o Claude Code por um único comando. Ambos iniciam o mesmo pacote de servidor.

Uma mulher trabalhando em um notebook em uma mesa de mármore de um café, junto a uma janela da rua

Configuração do Claude Desktop

  1. Instale o uv, o executor de Python que fornece uvx.
  2. No Claude Desktop, abra Configurações, depois Desenvolvedor e depois Editar configuração.
  3. Adicione um bloco de servidor como este:
{
  "mcpServers": {
    "veo": {
      "command": "uvx",
      "args": ["veo-mcp-server"],
      "env": {
        "VIDEO_OUTPUT_DIR": "./videos"
      }
    }
  }
}
  1. Adicione sua credencial do Gemini nesse mesmo bloco env, usando o nome da variável que o README escolhido lista.
  2. Feche o Claude Desktop por completo e abra-o de novo. As ferramentas do Veo devem aparecer no menu de ferramentas.

💡 As variáveis de pasta de saída variam de servidor para servidor. Um README usa VIDEO_OUTPUT_DIR, outro usa VEO_OUTPUT_DIR. Copie o nome do projeto que você instalou.

Se as ferramentas não aparecerem, valide o JSON primeiro, porque uma única vírgula sobrando quebra o arquivo inteiro. Depois confirme se uvx está no seu PATH e se você fechou o aplicativo de fato, em vez de só fechar a janela.

Configuração do Claude Code

Um comando registra o servidor para todos os projetos que você abrir:

claude mcp add veo -s user -- uvx veo-mcp-server

Passe sua credencial com a flag -e e depois rode /mcp para confirmar que o servidor aparece como conectado. Feito isso, um prompt como "Gere um clipe vertical de 6 segundos de chuva na janela de um bonde, sem música, e depois me diga onde o arquivo foi salvo" produz uma chamada de início, várias verificações de status e, no fim, um caminho de arquivo. Na primeira execução, peça um clipe de 4 segundos em 720p, para que uma configuração errada ou um prompt vago custe centavos em vez de dólares.

Conecte o Veo ao Gemini

Você tem duas opções. O Gemini CLI pode carregar os mesmos servidores MCP, e o app do Gemini pode gerar clipes do Veo por conta própria.

Vista de cima de uma mesa com um celular tocando um vídeo de litoral ao lado de um notebook

Configuração do Gemini CLI

O Gemini CLI lê ~/.gemini/settings.json e espera os servidores dentro de um objeto mcpServers, na mesma estrutura que o Claude usa:

{
  "mcpServers": {
    "veo": {
      "command": "uvx",
      "args": ["veo-mcp-server"],
      "env": {
        "VIDEO_OUTPUT_DIR": "./videos"
      }
    }
  }
}

Adicione também a variável da credencial aqui, reinicie a CLI e rode /mcp para listar todas as ferramentas carregadas. O Gemini CLI também aceita servidores SSE e de streaming HTTP, então um servidor hospedado funciona, desde que seja um em que você confie, desde que seja um em que você confie.

Se você quer que um modelo de chat elabore listas de planos antes de gastar qualquer coisa com renderização, o Gemini 3.5 Flash é rápido para rascunhos e o Gemini 3.1 Pro combina com roteiros mais longos.

O app do Gemini sem MCP

O app do Gemini também pode gerar vídeos do Veo diretamente, em planos compatíveis. Essa opção serve para clipes avulsos. Ela não oferece roteirização, lotes nem um caminho de arquivo que você controle. No momento em que você precisa de resultados repetíveis, o MCP vence.

Prompts que geram clipes melhores

O Veo 3.1 renderiza clipes de 4, 6 ou 8 segundos em 16:9 ou 9:16, com áudio gerado junto da imagem. Ele aceita um prompt negativo, um seed, até 3 imagens de referência e um primeiro e último quadro. Os exemplos do próprio modelo na PicassoIA escrevem diálogos e o som do ambiente diretamente no prompt, então trate o prompt como um roteiro, não como uma lista de tags.

Mãos de um cineasta esboçando um storyboard a lápis ao lado de um fotômetro antigo

Plano, sujeito, movimento, som

Monte cada prompt em quatro etapas:

  1. Plano: lente, ângulo e distância, como "contra-plongée, 35mm, aproximação lenta".
  2. Sujeito: quem ou o que está na tela, com dois ou três detalhes concretos.
  3. Movimento: o que muda ao longo do clipe, em ordem.
  4. Som: ruído ambiente, música ou diálogo entre aspas.

O som é a etapa que a maioria das pessoas pula. O modelo gera áudio por padrão, então descreva o ambiente sonoro e qualquer fala, e escreva "sem música" quando quiser apenas som natural. Quando sua ferramenta oferecer uma chave de áudio, desligá-la lhe dá imagens sem som para trilhar depois.

Um exemplo prático: Contra-plongée, 35mm, aproximação lenta sobre uma caneca de chá de cerâmica em um peitoril molhado de chuva. O vapor sobe em espirais, uma gota escorre pelo vidro logo atrás. Chuva suave, um sino de bonde ao longe, sem música.

Prompt fracoPrompt forte
Um vídeo legal da cidadeRecuo aéreo sobre um mercado de rua molhado de chuva ao entardecer, vendedores baixando as lonas, lâmpadas de fio quentes refletidas no asfalto molhado, trovão distante e vozes murmurando
Uma pessoa falandoPlano médio de uma mulher de casaco de lã numa plataforma de trem, ela diz "Quem for o último a chegar em casa apaga as luzes", com um anúncio da estação ecoando atrás dela

💡 Coloque o que você não quer, como textos sobrepostos ou tremor de câmera na mão, no prompt negativo, e não no prompt principal.

Quadro inicial e quadro final

A imagem para vídeo oferece o maior controle. Defina image como o primeiro quadro e last_frame como o último, e o modelo constrói a transição entre eles. As entradas ideais têm a mesma proporção da saída, cerca de 1280x720 para 16:9 ou 720x1280 para 9:16. Você pode gerar essas imagens com o PicassoIA Image, que oferece as duas proporções.

Dois limites para lembrar: imagens de referência só funcionam em 16:9 e 8 segundos, e o último quadro é ignorado sempre que houver imagens de referência.

O custo real por clipe

O próprio servidor MCP não custa nada. O Google cobra pelo uso da API do Gemini por segundo de vídeo, áudio incluído, e o mesmo clipe pode custar 8 vezes mais ou 8 vezes menos, dependendo do nível escolhido.

Uma calculadora, um cronômetro e um caderno sobre uma mesa de nogueira escura

Tarifas por segundo

Tarifas publicadas da API do Gemini no momento em que este texto foi escrito:

Nível720p1080p4K8 segundos em 1080p
Veo 3.1US$ 0,40US$ 0,40US$ 0,60US$ 3,20
Veo 3.1 FastUS$ 0,10US$ 0,12US$ 0,30US$ 0,96
Veo 3.1 LiteUS$ 0,05US$ 0,08Não oferecidoUS$ 0,64

Confira a página de preços do Google antes de montar o orçamento, já que as tarifas mudam. Em 1080p e 4K, os clipes têm 8 segundos.

Escolha o nível certo

  • Faça rascunhos no Lite ou no Fast em 720p. Um rascunho de 8 segundos no Fast custa US$ 0,80, e um rascunho no Lite custa US$ 0,40.
  • Renderize a versão final no nível padrão do Veo 3.1 quando a qualidade for o que mais importa. O Lite não tem 4K nem extensão.
  • Faça lotes com um teto. Vinte clipes sociais de 8 segundos somam 160 segundos de vídeo: US$ 8,00 no Lite em 720p, US$ 19,20 no Fast em 1080p, US$ 64,00 no padrão em 1080p.

💡 Dez rascunhos de 8 segundos em 720p custam US$ 8 no Fast e US$ 32 no padrão. Itere barato e pague uma vez pela versão final.

Mais um custo que não aparece na fatura: o README do alohc avisa que os vídeos gerados ficam nos servidores do Google por cerca de 2 dias. Garanta que seu servidor baixe cada arquivo para o disco no mesmo dia.

Como usar o Veo 3.1 na PicassoIA

Dispense as credenciais, os arquivos de configuração e a conta de faturamento. A página do modelo na PicassoIA oferece os mesmos controles no navegador, e o clipe aparece na sua galeria pronto para baixar.

Um rapaz assistindo a uma prévia de rodovia no deserto em um monitor grande de estúdio

Configurações que importam

  1. Abra o Veo 3.1 na PicassoIA.
  2. Escreva seu prompt usando as quatro etapas acima.
  3. Escolha as opções da tabela abaixo.
  4. Opcionalmente, adicione um primeiro quadro, um último quadro, até 3 imagens de referência, um prompt negativo ou um seed.
  5. Gere, visualize e baixe o MP4.
ConfiguraçãoOpçõesPadrão
Duração4, 6 ou 8 segundos8
Resolução720p ou 1080p1080p
Proporção16:9 ou 9:1616:9
ÁudioLigado ou desligadoLigado

O Veo 3.1 Fast usa as mesmas configurações, exceto as imagens de referência, que ele não oferece. Escolha-o para rascunhos rápidos: os exemplos Fast da página foram renderizados em 45 a 59 segundos, enquanto os exemplos do modelo padrão levaram cerca de 73 a 114 segundos.

A PicassoIA pelo MCP

A PicassoIA também tem uma API para desenvolvedores em https://api.picassoia.com/v1, com endpoints de predição no estilo Replicate e autenticação Bearer, além de um conector MCP. Ambos expõem quatro modelos: um modelo de imagem, um editor de imagens, um modelo de vídeo e o Seedance 2.5 Lite com áudio. O Veo 3.1 não está nessa lista, então, para o Veo, use a página do modelo, e para vídeo roteirizado dentro do Claude você pode chamar o PicassoIA Video ou o Seedance 2.5 Lite. Cada conta roda até 5 predições ao mesmo tempo, compartilhadas entre as conexões.

Faça seu primeiro clipe

Escolha uma frase que você poderia filmar em um único plano. Uma mão servindo chá, um bonde atravessando uma ponte, um cachorro esperando na porta. Cenas curtas e concretas dão ao Veo o alvo mais claro, e são as mais baratas para repetir.

Um cineasta num terraço na hora dourada segurando um tablet com um clipe finalizado

Três erros para evitar

  1. Esquecer a expiração. Os vídeos deixados nos servidores do Google desaparecem após cerca de 2 dias, então baixe-os.
  2. Fazer rascunhos em 4K. Faça rascunhos baratos e finalize uma vez.
  3. Pular a ferramenta de status. Clientes que esperam por uma chamada longa dão timeout. Use IDs de tarefa e consulte o status.

Pronto para testar você mesmo? Abra a PicassoIA, gere um primeiro quadro com o PicassoIA Image e depois anime-o com o Veo 3.1. Mude um detalhe por execução, compare os resultados com o Seedance 2.5 Lite e guarde as versões de que gostar. Suas próprias imagens e vídeos estão a um prompt de distância na Picasso IA, e a lista completa de modelos está esperando em picassoia.com/en/all-models.

Compartilhe este artigo

Escolha seu idioma