Servidor MCP de geração de vídeo: Veo, Kling e Seedance em um só chat
Um servidor MCP de geração de vídeo permite que um só chat peça clipes ao Veo, ao Kling e ao Seedance sem trocar de aba. Este artigo mostra como funcionam as ferramentas, os jobs assíncronos e o polling, qual modelo serve para cada tipo de cena, quais limites esperar e como escrever prompts que sobrevivam à primeira renderização.
Você tem uma aba do Veo aberta, uma do Kling em outra janela e uma do Seedance que esqueceu de fechar, e a cena que você procura pode estar em qualquer uma das três. Cada gerador pede um formato de prompt próprio, um painel de configurações próprio e um botão de download próprio. Um servidor MCP de geração de vídeo substitui essa rotina por uma frase digitada em um chat: você descreve o clipe, o assistente escolhe um modelo, envia o job, acompanha o andamento e entrega um link. Este artigo mostra como essa configuração funciona, o que o Veo 3.1, o Kling v3 Video e o Seedance 2.5 Lite fazem de melhor e como escrever prompts que sobrevivam à primeira renderização.
Por que um chat vence cinco abas
O custo de trocar de aba
Trocar de ferramenta parece inofensivo até você contar os passos. Você copia um prompt para um site, espera, baixa o arquivo, renomeia, abre o próximo site, cola, percebe que o segundo modelo quer o áudio descrito de outro jeito e reescreve tudo. Na terceira tentativa, você já perdeu o controle de qual seed gerou qual clipe, e a pasta da área de trabalho virou uma pilha de arquivos com nomes como "final_v2_mesmo".
Um chat inverte essa lógica. A própria conversa vira o arquivo do projeto: cada prompt, cada configuração e cada link de resultado fica em uma rolagem que você pode pesquisar depois. O assistente também pode transformar um único briefing criativo em três prompts específicos para cada modelo, que é justamente a parte tediosa que ninguém gosta de fazer à mão.
O que o MCP realmente faz
O Model Context Protocol é um padrão aberto, apresentado pela Anthropic no fim de 2024, que permite a um app de chat conversar com ferramentas externas de maneira previsível. Um servidor anuncia uma lista de ferramentas. Cada ferramenta tem um nome, uma descrição em linguagem simples e um esquema JSON que detalha suas entradas. O app de chat mostra essa lista ao modelo, o modelo decide quando uma ferramenta se encaixa, e o app encaminha a chamada ao servidor e devolve o resultado à conversa.
Os servidores rodam localmente via stdio ou remotamente via HTTP, então um servidor de vídeo pode ser um pequeno processo no seu notebook ou um endpoint hospedado que você conecta uma única vez. Do ponto de vista do chat, "faça um clipe de cinco segundos de um cozinheiro em um mercado noturno" deixa de ser um desejo vago e vira uma chamada estruturada, com prompt, duração e resolução.
💡 Dica: As descrições das ferramentas importam mais do que as pessoas imaginam. O modelo as lê para decidir qual ferramenta chamar, então um servidor que diz "gere um vídeo a partir de um prompt de texto" é acionado com muito mais consistência do que um que diz "execute job".
Como o servidor lida com jobs de vídeo
Ferramentas, esquemas e polling
O conector do PicassoIA é um bom exemplo concreto, porque sua lista de ferramentas é curta e legível. No momento em que este texto foi escrito, ele expõe estas ferramentas:
Retorna seu plano e os limites de execução paralela
cancel_generation
Cancela um job, a menos que a GPU já esteja renderizando o vídeo
Cada ferramenta de geração retorna um predict_id assim que uma GPU aceita o job, junto com um tempo estimado. Você então chama get_generation após a espera sugerida e de novo após cada espera que ele devolver, até que o status indique succeeded ou failed. Uma falha é definitiva, então o assistente envia uma nova geração em vez de tentar de novo a mesma.
Por que vídeo precisa de jobs assíncronos
Uma chamada de texto para imagem retorna em segundos. Um vídeo não. Os exemplos de renderização nas páginas dos modelos dão uma ideia: os exemplos do Veo 3.1 levaram cerca de um a dois minutos, os do Seedance 2.5 Lite cerca de dois a três minutos, e os do Kling v3 Video variaram de cinco a dezoito minutos, dependendo da duração e das configurações. Uma chamada de ferramenta no chat não consegue ficar parada por tanto tempo.
Por isso o servidor devolve um ticket e deixa o assistente acompanhar. É também por isso que seu chat pode continuar conversando enquanto um clipe é renderizado: peça o prompt da próxima cena enquanto a primeira está sendo preparada.
Como é uma sessão
Aqui está uma troca realista depois que o servidor é conectado:
Você digita: "Faça um clipe de 5 segundos em 16:9 de um cozinheiro jogando macarrão em um mercado noturno, lâmpadas quentes, som de chiado."
O assistente escolhe a ferramenta de vídeo, preenche o prompt, a duração e a resolução, e envia.
O servidor responde com um predict_id e um tempo estimado.
O assistente espera o intervalo sugerido, chama get_generation, vê que o job ainda está em processamento e espera de novo.
O status muda para succeeded, e o assistente posta o link do MP4 no chat.
Você diz "mesma cena, mas o cozinheiro olha para a câmera", e o assistente reenvia com o mesmo seed e uma linha de movimento editada.
Todo o ciclo acontece em uma só janela, e nada disso exige que você leia uma referência de API.
Cinco jobs por vez
A documentação da API do PicassoIA indica 5 predições simultâneas por conta, compartilhadas entre seu acesso à API e suas conexões MCP. Para um storyboard de oito cenas, isso significa que o assistente deve enviar cinco, acompanhar, e enfileirar o resto conforme as vagas forem liberadas. Você pode dizer isso em palavras simples: "Execute as cenas em lotes de cinco e poste cada link assim que terminar."
Três modelos, três pontos fortes
Nenhum modelo único vence todas as cenas, e esse é o verdadeiro argumento para colocar vários atrás de um só chat. Veja o que as páginas dos modelos dizem que cada um foi feito para fazer.
Quando realismo e som importam
O Veo 3.1 transforma um prompt de texto em vídeo de 1080p com áudio sensível ao contexto, então o barulho, o vento ou as vozes chegam combinados com a imagem. Os clipes têm 4, 6 ou 8 segundos, em 16:9 ou 9:16. Você pode definir um primeiro quadro e um último quadro para fazer a transição entre dois momentos, ou fornecer até três imagens de referência para manter um sujeito consistente entre cenas. Um campo de prompt negativo permite excluir o que você não quer. Uma variante mais rápida, o Veo 3.1 Fast, existe para rascunhos mais ágeis.
Use-o quando a cena for um momento crível do mundo real: um carro em uma estrada litorânea, uma conversa em um café, um produto sobre uma mesa com som ambiente natural.
Quando você precisa de controle multicena
O Kling v3 Video é a opção para formatos longos. Ele produz clipes de até 15 segundos e oferece roteiro multicena: você define até 6 cenas, cada uma com seu próprio prompt e duração, dentro de uma única geração. O modo padrão renderiza em 720p e o modo pro em 1080p. Você pode fixar o primeiro e o último quadro com imagens, escolher 16:9, 9:16 ou 1:1, e adicionar um prompt negativo. A geração de áudio é um interruptor que vem desligado por padrão, então peça ao chat para ligá-lo quando quiser som.
É o modelo a usar quando um clipe precisa de um pequeno arco, como um plano geral, um close e uma reação, sem costurar três arquivos separados. Espere os tempos mais longos do grupo.
Quando você quer iterações rápidas
O Seedance 2.5 Lite foi feito para volume. Ele gera clipes de 5 ou 10 segundos em 480p ou 720p, com áudio sincronizado ligado por padrão, a partir de texto ou de uma imagem inicial, e aceita um seed que você pode fixar para reproduzir um resultado. A página do modelo o descreve como ilimitado para membros Wonder, o que o torna o modelo natural para testar dez variações de prompt antes do almoço. Existem irmãos maiores para quando você precisar de mais: o Seedance 2.5 aparece com clipes de até 30 segundos, e o Seedance 2.0 oferece texto para vídeo com áudio integrado.
Escolhendo o modelo certo por cena
Coloque as especificações lado a lado e as decisões de roteamento ficam mais fáceis. Os tempos de renderização vêm dos exemplos de geração em cada página de modelo, então trate-os como estimativas, não como promessas.
Uma mini-história com várias cenas em um só arquivo:Kling v3 Video.
Rascunhos rápidos, muitas variações, loops para redes sociais:Seedance 2.5 Lite.
💡 Dica: Faça o rascunho no modelo rápido e finalize no lento. Defina a ideia, o enquadramento e o movimento com iterações rápidas, e então gaste as renderizações longas nas cenas que você já aprovou.
Os clipes brutos raramente são o último passo. O PicassoIA também oferece edição de vídeo, aumento de resolução de vídeo e um grande catálogo de efeitos visuais, que é onde você adiciona um visual estilizado ou uma limpeza depois que o gerador faz seu trabalho. A lista completa está em picassoia.com/en/all-models.
Escrevendo prompts que o chat pode reaproveitar
Listas de cenas vencem adjetivos
A página do modelo Seedance 2.5 Lite diz que descrições cinematográficas e cronológicas funcionam melhor, e o mesmo hábito ajuda com todos os modelos de vídeo. Descreva o que acontece em ordem, do jeito que um diretor lê uma lista de planos, em vez de empilhar adjetivos como "épico" e "deslumbrante". O modelo não consegue filmar um adjetivo, mas consegue filmar um cozinheiro que joga o macarrão uma vez enquanto as chamas se erguem.
Um modelo de prompt que funciona
Uma estrutura de quatro linhas mantém os prompts consistentes quando o assistente os reescreve para modelos diferentes:
Subject and starting pose.
What moves, in order, over the clip.
Camera move.
Light and sound.
Preenchido, fica assim:
Um cozinheiro de comida de rua, de avental de lona, segura um wok sobre uma chama de gás. Ele joga o macarrão uma vez, as chamas se erguem, o vapor avança em direção à lente. Aproximação lenta a partir da altura do peito. Lâmpadas quentes no alto, óleo chiando e o burburinho do mercado.
Depois, peça ao chat para adaptar por modelo. Para o Veo 3.1, detalhe o som, porque o áudio segue o prompt. Para o Kling v3 Video, divida os momentos em cenas e faça com que as durações das cenas somem a duração total, com pelo menos um segundo por cena. Para o Seedance 2.5 Lite, mantenha um único parágrafo fluido e fixe o seed quando gostar do resultado.
Se o modelo de chat que você usa for fraco em descrições de cena, faça os prompts com um redator mais forte, como o Claude Sonnet 5 ou o Gemini 3.5 Flash, e cole o resultado na conversa.
Corrigindo uma primeira renderização fraca
Mude uma variável por vez. Fixe o seed e então edite apenas a linha de movimento. Alguns hábitos economizam horas:
O sujeito se desloca: forneça uma imagem de primeiro quadro para que o modelo comece de um visual fixo.
Objetos indesejados aparecem: use o campo de prompt negativo que o Veo 3.1 e o Kling v3 Video oferecem.
O clipe parece carregado: encurte-o. Um clipe de cinco segundos com uma ação vence um de dez segundos com três.
💡 Dica: Combine as ferramentas. Gere uma imagem fixa com a ferramenta de imagem, aprove o enquadramento e então use essa imagem como primeiro quadro para que o vídeo comece exatamente onde você quer.
O Seedance 2.5 Lite é a primeira parada prática, porque é rápido, lida com o áudio por padrão e é uma das duas ferramentas de vídeo do conector. Veja o fluxo no PicassoIA:
Abra a página do Seedance 2.5 Lite, ou peça ao chat para chamar generate_video_seedance.
Escreva o prompt em ordem cronológica, usando o modelo de quatro linhas acima.
Escolha uma duração de 5 ou 10 segundos. Use 5 enquanto estiver testando.
Escolha uma resolução. O 480p renderiza mais rápido e serve para rascunhos; o 720p é mais nítido e serve para a versão que você vai guardar.
Escolha uma proporção, ou envie uma imagem para usar como quadro de abertura. Com uma imagem, o clipe segue a imagem e ignora a configuração de proporção.
Deixe salvar áudio ligado, a menos que você queira um clipe silencioso.
Defina um seed se quiser reproduzir o resultado depois.
Envie, acompanhe até o job dar certo e abra o link devolvido.
Configuração
Opções
Quando mudar
Duração
5 ou 10 segundos
Vá para 10 quando a ação precisar de espaço
Resolução
480p ou 720p
480p para rascunhos, 720p para os que você vai manter
Proporção
16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3
Combine com a plataforma onde você publica
Imagem de entrada
Opcional
Fixa o visual do primeiro quadro
Imagem do último quadro
Opcional, precisa de uma imagem de entrada
Controla como a cena termina
Seed
Qualquer número inteiro
Reproduzir ou comparar tomadas
Salvar áudio
Ligado ou desligado
Desligado para imagens de apoio silenciosas
O mesmo fluxo para Veo e Kling
Os mesmos passos valem, com algumas trocas. No Veo 3.1, escolha 4, 6 ou 8 segundos e 720p ou 1080p. Imagens de referência funcionam apenas com 16:9 e 8 segundos, e um último quadro é ignorado quando há referências. No Kling v3 Video, escolha o modo padrão (720p) ou pro (1080p), ligue o áudio, mantenha o prompt abaixo de 2.500 caracteres e adicione uma lista multicena quando quiser várias cenas.
Limites com os quais planejar
Fila, novas tentativas e falhas
Limite paralelo: 5 predições simultâneas por conta, compartilhadas entre as conexões. Planeje seus lotes de cinco em cinco.
Falhas definitivas: consultar um job que falhou não o fará voltar. O assistente deve enviar um novo, de preferência com um prompt mais simples.
Tamanho do prompt: a API do PicassoIA aceita prompts de até 4.000 caracteres, e o Kling v3 Video limita o próprio prompt a 2.500, então escreva primeiro a versão mais curta.
Cancelamento: um job pode ser cancelado até a GPU começar a renderizar o vídeo. Depois disso, ele roda até o fim.
O que o conector não faz
O escopo merece uma frase honesta. No momento em que este texto foi escrito, o conector do PicassoIA lista quatro modelos: um gerador de imagens, um editor de imagens, o PicassoIA Video e o Seedance 2.5 Lite. O Veo 3.1 e o Kling v3 Video funcionam pelo site do PicassoIA, e trazê-los para o mesmo chat exigiria um servidor MCP próprio que encapsule as APIs de seus provedores.
Execute list_models na sua própria conta para ver o que está exposto hoje, e confira picassoia.com/en/pricing para saber quais planos incluem conexões MCP antes de montar um fluxo de trabalho em cima delas.
Crie seu primeiro clipe hoje
Escolha uma cena que você normalmente filmaria ou compraria como material de banco de imagens, escreva-a como um prompt de quatro linhas e rode em todos os três modelos. Coloque o Seedance 2.5 Lite primeiro para um rascunho rápido, envie a versão aprovada ao Veo 3.1 para um som realista ou ao Kling v3 Video para um corte multicena, e compare os resultados lado a lado. Em uma tarde você vai saber para qual modelo o seu estilo tende.
Você pode testar tudo isso no Picasso IA. Gere uma imagem fixa com um dos modelos de imagem, use-a como primeiro quadro e veja-a se mover. Explore o catálogo completo em picassoia.com/en/all-models e rode seu primeiro prompt hoje à noite.