Servidor MCP de geração de vídeo: Veo, Kling e Seedance em um só chat

Um servidor MCP de geração de vídeo permite que um só chat peça clipes ao Veo, ao Kling e ao Seedance sem trocar de aba. Este artigo mostra como funcionam as ferramentas, os jobs assíncronos e o polling, qual modelo serve para cada tipo de cena, quais limites esperar e como escrever prompts que sobrevivam à primeira renderização.

Servidor MCP de geração de vídeo: Veo, Kling e Seedance em um só chat
Cristian Da Conceicao
Fundador do Picasso IA

Você tem uma aba do Veo aberta, uma do Kling em outra janela e uma do Seedance que esqueceu de fechar, e a cena que você procura pode estar em qualquer uma das três. Cada gerador pede um formato de prompt próprio, um painel de configurações próprio e um botão de download próprio. Um servidor MCP de geração de vídeo substitui essa rotina por uma frase digitada em um chat: você descreve o clipe, o assistente escolhe um modelo, envia o job, acompanha o andamento e entrega um link. Este artigo mostra como essa configuração funciona, o que o Veo 3.1, o Kling v3 Video e o Seedance 2.5 Lite fazem de melhor e como escrever prompts que sobrevivam à primeira renderização.

Por que um chat vence cinco abas

O custo de trocar de aba

Trocar de ferramenta parece inofensivo até você contar os passos. Você copia um prompt para um site, espera, baixa o arquivo, renomeia, abre o próximo site, cola, percebe que o segundo modelo quer o áudio descrito de outro jeito e reescreve tudo. Na terceira tentativa, você já perdeu o controle de qual seed gerou qual clipe, e a pasta da área de trabalho virou uma pilha de arquivos com nomes como "final_v2_mesmo".

Homem de moletom cinza-carvão verificando uma janela de chat no notebook sobre a mesa da cozinha durante o café da manhã

Um chat inverte essa lógica. A própria conversa vira o arquivo do projeto: cada prompt, cada configuração e cada link de resultado fica em uma rolagem que você pode pesquisar depois. O assistente também pode transformar um único briefing criativo em três prompts específicos para cada modelo, que é justamente a parte tediosa que ninguém gosta de fazer à mão.

O que o MCP realmente faz

O Model Context Protocol é um padrão aberto, apresentado pela Anthropic no fim de 2024, que permite a um app de chat conversar com ferramentas externas de maneira previsível. Um servidor anuncia uma lista de ferramentas. Cada ferramenta tem um nome, uma descrição em linguagem simples e um esquema JSON que detalha suas entradas. O app de chat mostra essa lista ao modelo, o modelo decide quando uma ferramenta se encaixa, e o app encaminha a chamada ao servidor e devolve o resultado à conversa.

Os servidores rodam localmente via stdio ou remotamente via HTTP, então um servidor de vídeo pode ser um pequeno processo no seu notebook ou um endpoint hospedado que você conecta uma única vez. Do ponto de vista do chat, "faça um clipe de cinco segundos de um cozinheiro em um mercado noturno" deixa de ser um desejo vago e vira uma chamada estruturada, com prompt, duração e resolução.

Close de mãos de mulher digitando em um notebook ao lado de uma xícara de chá fumegante

💡 Dica: As descrições das ferramentas importam mais do que as pessoas imaginam. O modelo as lê para decidir qual ferramenta chamar, então um servidor que diz "gere um vídeo a partir de um prompt de texto" é acionado com muito mais consistência do que um que diz "execute job".

Como o servidor lida com jobs de vídeo

Ferramentas, esquemas e polling

O conector do PicassoIA é um bom exemplo concreto, porque sua lista de ferramentas é curta e legível. No momento em que este texto foi escrito, ele expõe estas ferramentas:

FerramentaO que faz
generate_imageInicia um job de geração de imagem
edit_imageEdita uma imagem existente
generate_video_picassoiaInicia um clipe com o PicassoIA Video
generate_video_seedanceInicia um clipe com o Seedance 2.5 Lite
get_generationVerifica um job pelo seu predict_id
list_generationsMostra seus jobs recentes
list_modelsLista os modelos que sua conta pode usar
get_accountRetorna seu plano e os limites de execução paralela
cancel_generationCancela um job, a menos que a GPU já esteja renderizando o vídeo

Cada ferramenta de geração retorna um predict_id assim que uma GPU aceita o job, junto com um tempo estimado. Você então chama get_generation após a espera sugerida e de novo após cada espera que ele devolver, até que o status indique succeeded ou failed. Uma falha é definitiva, então o assistente envia uma nova geração em vez de tentar de novo a mesma.

Por que vídeo precisa de jobs assíncronos

Uma chamada de texto para imagem retorna em segundos. Um vídeo não. Os exemplos de renderização nas páginas dos modelos dão uma ideia: os exemplos do Veo 3.1 levaram cerca de um a dois minutos, os do Seedance 2.5 Lite cerca de dois a três minutos, e os do Kling v3 Video variaram de cinco a dezoito minutos, dependendo da duração e das configurações. Uma chamada de ferramenta no chat não consegue ficar parada por tanto tempo.

Por isso o servidor devolve um ticket e deixa o assistente acompanhar. É também por isso que seu chat pode continuar conversando enquanto um clipe é renderizado: peça o prompt da próxima cena enquanto a primeira está sendo preparada.

Como é uma sessão

Aqui está uma troca realista depois que o servidor é conectado:

  1. Você digita: "Faça um clipe de 5 segundos em 16:9 de um cozinheiro jogando macarrão em um mercado noturno, lâmpadas quentes, som de chiado."
  2. O assistente escolhe a ferramenta de vídeo, preenche o prompt, a duração e a resolução, e envia.
  3. O servidor responde com um predict_id e um tempo estimado.
  4. O assistente espera o intervalo sugerido, chama get_generation, vê que o job ainda está em processamento e espera de novo.
  5. O status muda para succeeded, e o assistente posta o link do MP4 no chat.
  6. Você diz "mesma cena, mas o cozinheiro olha para a câmera", e o assistente reenvia com o mesmo seed e uma linha de movimento editada.

Todo o ciclo acontece em uma só janela, e nada disso exige que você leia uma referência de API.

Cinco jobs por vez

A documentação da API do PicassoIA indica 5 predições simultâneas por conta, compartilhadas entre seu acesso à API e suas conexões MCP. Para um storyboard de oito cenas, isso significa que o assistente deve enviar cinco, acompanhar, e enfileirar o resto conforme as vagas forem liberadas. Você pode dizer isso em palavras simples: "Execute as cenas em lotes de cinco e poste cada link assim que terminar."

Mãos de um desenvolvedor digitando em uma mesa de escritório doméstico com pouca luz e uma pequena suculenta ao lado

Três modelos, três pontos fortes

Nenhum modelo único vence todas as cenas, e esse é o verdadeiro argumento para colocar vários atrás de um só chat. Veja o que as páginas dos modelos dizem que cada um foi feito para fazer.

Quando realismo e som importam

O Veo 3.1 transforma um prompt de texto em vídeo de 1080p com áudio sensível ao contexto, então o barulho, o vento ou as vozes chegam combinados com a imagem. Os clipes têm 4, 6 ou 8 segundos, em 16:9 ou 9:16. Você pode definir um primeiro quadro e um último quadro para fazer a transição entre dois momentos, ou fornecer até três imagens de referência para manter um sujeito consistente entre cenas. Um campo de prompt negativo permite excluir o que você não quer. Uma variante mais rápida, o Veo 3.1 Fast, existe para rascunhos mais ágeis.

Use-o quando a cena for um momento crível do mundo real: um carro em uma estrada litorânea, uma conversa em um café, um produto sobre uma mesa com som ambiente natural.

Vista aérea de um conversível creme em uma estrada sinuosa à beira-mar na hora dourada

Quando você precisa de controle multicena

O Kling v3 Video é a opção para formatos longos. Ele produz clipes de até 15 segundos e oferece roteiro multicena: você define até 6 cenas, cada uma com seu próprio prompt e duração, dentro de uma única geração. O modo padrão renderiza em 720p e o modo pro em 1080p. Você pode fixar o primeiro e o último quadro com imagens, escolher 16:9, 9:16 ou 1:1, e adicionar um prompt negativo. A geração de áudio é um interruptor que vem desligado por padrão, então peça ao chat para ligá-lo quando quiser som.

É o modelo a usar quando um clipe precisa de um pequeno arco, como um plano geral, um close e uma reação, sem costurar três arquivos separados. Espere os tempos mais longos do grupo.

Fotografia em contra-plongée de uma bailarina congelada no meio de um giro em um estúdio iluminado, com um vestido de linho esvoaçante

Quando você quer iterações rápidas

O Seedance 2.5 Lite foi feito para volume. Ele gera clipes de 5 ou 10 segundos em 480p ou 720p, com áudio sincronizado ligado por padrão, a partir de texto ou de uma imagem inicial, e aceita um seed que você pode fixar para reproduzir um resultado. A página do modelo o descreve como ilimitado para membros Wonder, o que o torna o modelo natural para testar dez variações de prompt antes do almoço. Existem irmãos maiores para quando você precisar de mais: o Seedance 2.5 aparece com clipes de até 30 segundos, e o Seedance 2.0 oferece texto para vídeo com áudio integrado.

Cozinheiro de comida de rua jogando macarrão em um wok enegrecido em um mercado noturno

Escolhendo o modelo certo por cena

Coloque as especificações lado a lado e as decisões de roteamento ficam mais fáceis. Os tempos de renderização vêm dos exemplos de geração em cada página de modelo, então trate-os como estimativas, não como promessas.

Veo 3.1Kling v3 VideoSeedance 2.5 Lite
Duração do clipe4, 6 ou 8 segundosAté 15 segundos5 ou 10 segundos
Resolução máxima1080p1080p (modo pro)720p
ÁudioLigado por padrãoDesligado por padrão, pode ser ativadoLigado por padrão
Multicena em uma execuçãoNãoAté 6 cenasNão
Primeiro e último quadroSimSimSim (o último quadro precisa de um primeiro)
Imagens de referênciaAté 3NãoNão
Tempo de renderização de exemplo1 a 2 minutos5 a 18 minutos2 a 3 minutos

Vista de cima de nove cartões de storyboard, um cronômetro e uma xícara de café sobre uma mesa de madeira

Uma regra prática de roteamento que se sustenta na prática:

  • Diálogo, som ambiente, locais críveis: Veo 3.1.
  • Uma mini-história com várias cenas em um só arquivo: Kling v3 Video.
  • Rascunhos rápidos, muitas variações, loops para redes sociais: Seedance 2.5 Lite.

💡 Dica: Faça o rascunho no modelo rápido e finalize no lento. Defina a ideia, o enquadramento e o movimento com iterações rápidas, e então gaste as renderizações longas nas cenas que você já aprovou.

Os clipes brutos raramente são o último passo. O PicassoIA também oferece edição de vídeo, aumento de resolução de vídeo e um grande catálogo de efeitos visuais, que é onde você adiciona um visual estilizado ou uma limpeza depois que o gerador faz seu trabalho. A lista completa está em picassoia.com/en/all-models.

Escrevendo prompts que o chat pode reaproveitar

Listas de cenas vencem adjetivos

A página do modelo Seedance 2.5 Lite diz que descrições cinematográficas e cronológicas funcionam melhor, e o mesmo hábito ajuda com todos os modelos de vídeo. Descreva o que acontece em ordem, do jeito que um diretor lê uma lista de planos, em vez de empilhar adjetivos como "épico" e "deslumbrante". O modelo não consegue filmar um adjetivo, mas consegue filmar um cozinheiro que joga o macarrão uma vez enquanto as chamas se erguem.

Mão com caneta-tinteiro escrevendo uma lista de cenas em um caderno ao lado de um carretel de filme de latão

Um modelo de prompt que funciona

Uma estrutura de quatro linhas mantém os prompts consistentes quando o assistente os reescreve para modelos diferentes:

Subject and starting pose.
What moves, in order, over the clip.
Camera move.
Light and sound.

Preenchido, fica assim:

Um cozinheiro de comida de rua, de avental de lona, segura um wok sobre uma chama de gás. Ele joga o macarrão uma vez, as chamas se erguem, o vapor avança em direção à lente. Aproximação lenta a partir da altura do peito. Lâmpadas quentes no alto, óleo chiando e o burburinho do mercado.

Depois, peça ao chat para adaptar por modelo. Para o Veo 3.1, detalhe o som, porque o áudio segue o prompt. Para o Kling v3 Video, divida os momentos em cenas e faça com que as durações das cenas somem a duração total, com pelo menos um segundo por cena. Para o Seedance 2.5 Lite, mantenha um único parágrafo fluido e fixe o seed quando gostar do resultado.

Se o modelo de chat que você usa for fraco em descrições de cena, faça os prompts com um redator mais forte, como o Claude Sonnet 5 ou o Gemini 3.5 Flash, e cole o resultado na conversa.

Corrigindo uma primeira renderização fraca

Mude uma variável por vez. Fixe o seed e então edite apenas a linha de movimento. Alguns hábitos economizam horas:

  • O sujeito se desloca: forneça uma imagem de primeiro quadro para que o modelo comece de um visual fixo.
  • Objetos indesejados aparecem: use o campo de prompt negativo que o Veo 3.1 e o Kling v3 Video oferecem.
  • O clipe parece carregado: encurte-o. Um clipe de cinco segundos com uma ação vence um de dez segundos com três.

💡 Dica: Combine as ferramentas. Gere uma imagem fixa com a ferramenta de imagem, aprove o enquadramento e então use essa imagem como primeiro quadro para que o vídeo comece exatamente onde você quer.

Como usar o Seedance 2.5 Lite

O Seedance 2.5 Lite é a primeira parada prática, porque é rápido, lida com o áudio por padrão e é uma das duas ferramentas de vídeo do conector. Veja o fluxo no PicassoIA:

  1. Abra a página do Seedance 2.5 Lite, ou peça ao chat para chamar generate_video_seedance.
  2. Escreva o prompt em ordem cronológica, usando o modelo de quatro linhas acima.
  3. Escolha uma duração de 5 ou 10 segundos. Use 5 enquanto estiver testando.
  4. Escolha uma resolução. O 480p renderiza mais rápido e serve para rascunhos; o 720p é mais nítido e serve para a versão que você vai guardar.
  5. Escolha uma proporção, ou envie uma imagem para usar como quadro de abertura. Com uma imagem, o clipe segue a imagem e ignora a configuração de proporção.
  6. Deixe salvar áudio ligado, a menos que você queira um clipe silencioso.
  7. Defina um seed se quiser reproduzir o resultado depois.
  8. Envie, acompanhe até o job dar certo e abra o link devolvido.
ConfiguraçãoOpçõesQuando mudar
Duração5 ou 10 segundosVá para 10 quando a ação precisar de espaço
Resolução480p ou 720p480p para rascunhos, 720p para os que você vai manter
Proporção16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3Combine com a plataforma onde você publica
Imagem de entradaOpcionalFixa o visual do primeiro quadro
Imagem do último quadroOpcional, precisa de uma imagem de entradaControla como a cena termina
SeedQualquer número inteiroReproduzir ou comparar tomadas
Salvar áudioLigado ou desligadoDesligado para imagens de apoio silenciosas

O mesmo fluxo para Veo e Kling

Os mesmos passos valem, com algumas trocas. No Veo 3.1, escolha 4, 6 ou 8 segundos e 720p ou 1080p. Imagens de referência funcionam apenas com 16:9 e 8 segundos, e um último quadro é ignorado quando há referências. No Kling v3 Video, escolha o modo padrão (720p) ou pro (1080p), ligue o áudio, mantenha o prompt abaixo de 2.500 caracteres e adicione uma lista multicena quando quiser várias cenas.

Limites com os quais planejar

Fila, novas tentativas e falhas

  • Limite paralelo: 5 predições simultâneas por conta, compartilhadas entre as conexões. Planeje seus lotes de cinco em cinco.
  • Falhas definitivas: consultar um job que falhou não o fará voltar. O assistente deve enviar um novo, de preferência com um prompt mais simples.
  • Tamanho do prompt: a API do PicassoIA aceita prompts de até 4.000 caracteres, e o Kling v3 Video limita o próprio prompt a 2.500, então escreva primeiro a versão mais curta.
  • Cancelamento: um job pode ser cancelado até a GPU começar a renderizar o vídeo. Depois disso, ele roda até o fim.

Cronômetro antigo ao lado de uma claquete sobre uma bancada de concreto

O que o conector não faz

O escopo merece uma frase honesta. No momento em que este texto foi escrito, o conector do PicassoIA lista quatro modelos: um gerador de imagens, um editor de imagens, o PicassoIA Video e o Seedance 2.5 Lite. O Veo 3.1 e o Kling v3 Video funcionam pelo site do PicassoIA, e trazê-los para o mesmo chat exigiria um servidor MCP próprio que encapsule as APIs de seus provedores.

Execute list_models na sua própria conta para ver o que está exposto hoje, e confira picassoia.com/en/pricing para saber quais planos incluem conexões MCP antes de montar um fluxo de trabalho em cima delas.

Crie seu primeiro clipe hoje

Escolha uma cena que você normalmente filmaria ou compraria como material de banco de imagens, escreva-a como um prompt de quatro linhas e rode em todos os três modelos. Coloque o Seedance 2.5 Lite primeiro para um rascunho rápido, envie a versão aprovada ao Veo 3.1 para um som realista ou ao Kling v3 Video para um corte multicena, e compare os resultados lado a lado. Em uma tarde você vai saber para qual modelo o seu estilo tende.

Você pode testar tudo isso no Picasso IA. Gere uma imagem fixa com um dos modelos de imagem, use-a como primeiro quadro e veja-a se mover. Explore o catálogo completo em picassoia.com/en/all-models e rode seu primeiro prompt hoje à noite.

Compartilhe este artigo

Escolha seu idioma