O Seedance 2.5 faz algo que a maioria dos modelos de vídeo não faz: leva a sério o material de referência. Envie uma imagem, um prompt de texto ou os dois juntos, e ele usa essas entradas como restrições ativas sobre o resultado, não apenas como inspiração vaga. Essa diferença é o que torna as referências multimodais a ferramenta mais prática em um fluxo de trabalho de iniciante no Seedance.
Este artigo explica o que são as referências multimodais, quais tipos de entrada funcionam melhor em cada situação e como montar um processo repetível que produz resultados cinematográficos consistentes toda vez que você clica em gerar.

O que o Seedance 2.5 faz de diferente
A maioria dos modelos de texto para vídeo opera com um único canal de entrada. Você escreve um prompt, o modelo o interpreta da melhor forma possível, e o resultado pode ou não corresponder ao que você imaginou. O Seedance 2.5 rompe essa premissa de canal único ao tratar imagem e texto como superfícies de controle separadas e simultâneas.
Dois canais de entrada, não um
O Seedance 2.5 aceita uma imagem de referência e um prompt de texto como entradas separadas que atuam em paralelo. A imagem define o ponto de partida visual: a composição, o sujeito, a paleta de cores e as relações espaciais entre os elementos. O prompt de texto define o movimento: o que se move, como se move e o arco de ação geral do clipe de 5 a 30 segundos.
Esses dois canais não são mesclados em uma única instrução. Eles funcionam de forma independente, e é isso que dá a você controle preciso sobre cada dimensão do resultado sem mexer nas outras.
💡 Alterar apenas o prompt de texto mantendo a mesma imagem de referência permite iterar sobre o movimento sem perder o estilo visual já definido. Esta é a forma mais rápida de refinar resultados sem refazer cada geração do zero.
Por que isso muda o resultado
Com um modelo de canal único, cada iteração exige reescrever o prompt inteiro. Se a composição está certa, mas o movimento não, você ainda precisa modificar um prompt que afeta as duas dimensões ao mesmo tempo. Com referências multimodais, você pode travar a imagem e iterar só no texto, ou travar o texto e trocar de imagem até que o enquadramento visual esteja certo.
Essa separação dá aos iniciantes um processo reproduzível em vez de uma loteria. A imagem de referência vira uma âncora estável. O prompt de texto passa a ser a única variável que você ajusta. Ao longo de várias gerações, você desenvolve uma noção intuitiva de quais estruturas de texto produzem o movimento desejado, e esse conhecimento se aplica a todas as próximas gerações no Seedance.

Os três tipos de referência que você pode usar
O Seedance 2.5 oferece três configurações distintas de referência. Saber quando usar cada uma é a base de um fluxo multimodal sólido.
Referências de imagem
Uma referência de imagem fixa o primeiro quadro do vídeo. O modelo lê o conteúdo espacial dessa imagem e a usa como base visual. Tudo no resultado, incluindo profundidade, direção da luz, posição do sujeito e textura do fundo, parte dessa imagem.
Esta configuração é mais útil para:
- Reproduzir um estilo visual específico em vários clipes
- Animar um sujeito a partir de uma fotografia que você já tem
- Controlar a gradação de cor e a faixa tonal sem escrevê-las no prompt de texto
A imagem não precisa ser gerada por IA. Uma fotografia bem composta funciona tão bem quanto um material gerado. Na prática, uma foto limpa, com alto contraste, um sujeito claro e iluminação consistente produz resultados mais nítidos do que uma imagem abstrata ou visualmente carregada.
Referências de texto
Uma referência de texto funciona como um roteiro de movimento. Ela diz ao modelo o que acontece durante o clipe: se a câmera avança lentamente, se o sujeito caminha da esquerda para a direita, se folhas passam pelo fundo.
Referências de texto fortes para o Seedance 2.5 seguem uma estrutura de quatro partes:
Sujeito + ação + movimento de câmera + atmosfera
Por exemplo: "Uma mulher está sentada em um banco de parque e vira a cabeça devagar em direção à câmera. A câmera permanece parada. O sol do fim da tarde filtra através das árvores. Uma leve brisa passa pelo cabelo dela."
Essa estrutura dá ao modelo informação suficiente para produzir um movimento coerente sem sobrecarregar a instrução. Cada detalhe extra além dessas quatro partes aumenta o risco de o modelo priorizar o elemento errado.

Entradas multimodais combinadas
Usar uma imagem e um prompt de texto juntos é onde o Seedance 2.5 mais claramente supera modelos de canal único. A imagem mantém o estado visual estável. O texto acrescenta o movimento. O resultado é um clipe que parece ter sido feito por um diretor com uma visão específica, e não por uma geração aleatória.
| Tipo de referência | Controla | Melhor uso |
|---|
| Somente imagem | Estilo visual, composição, sujeito | Animar uma fotografia existente |
| Somente texto | Movimento, ação, atmosfera | Quando você não tem imagem de origem |
| Imagem + texto | Estilo visual e movimento juntos | Resultados de qualidade de produção e repetíveis |
O fluxo combinado exige um pouco mais de preparação, mas a velocidade de iteração compensa com folga. Como você não precisa recomeçar do zero quando uma dimensão já está travada, gasta bem menos tempo com gerações malsucedidas.
Como escolher o material de referência certo
Nem toda imagem é uma boa referência. Nem toda descrição de texto se traduz bem em movimento. Veja o que separa entradas eficazes das que geram resultados confusos.
Imagens que funcionam bem
Separação clara entre sujeito e fundo. Se o modelo não consegue distinguir o sujeito do ambiente, ele animará os dois ao mesmo tempo, o que cria artefatos e movimentos não intencionais. Um retrato diante de uma parede lisa funciona melhor do que um retrato tirado em uma multidão densa.
Direção de iluminação consistente. Uma imagem de referência com luz chapada ou contraditória dá ao modelo informações conflitantes sobre profundidade e volume, e o resultado costuma apresentar superfícies cintilantes.
Pouco ou nenhum texto sobreposto. Texto em uma imagem de referência tende a se deformar no resultado ou a ficar rígido de forma pouco natural enquanto tudo ao redor se move. Remova logotipos, legendas ou marcas d’água das imagens de referência antes de usá-las.
Proporção 16:9. O Seedance 2.5 lida de forma mais previsível com referências em 16:9. Imagens quadradas ou verticais funcionam, mas o modelo pode reenquadrar ou recortar para ajustar às dimensões nativas de saída, o que altera a composição que você pretendia.

O que torna as referências de texto eficazes
Referências de texto eficazes são específicas sobre movimento e luz, e pouco específicas sobre estilo visual. A imagem já cuida do estilo, então seu prompt de texto não deve repetir descrições visuais que já estão presentes na referência. Se sua imagem mostra um pôr do sol dourado e quente, não escreva também "luz dourada e quente" no prompt. O modelo pode tentar atender à descrição de maneiras que entrem em conflito com a imagem que ele já tem.
O que as referências de texto devem especificar:
- Movimento do sujeito: direção, velocidade, quais partes do corpo se movem
- Movimento de câmera: travelling, panorâmica, inclinação ou quadro fixo
- Movimento do ambiente: vento na grama, água ondulando, objetos caindo, movimento de multidão
- Atmosfera sonora: o Seedance 2.5 gera áudio nativo sincronizado, então especificar o som (chuva, passos, trânsito, vozes ao fundo) influencia diretamente a trilha de áudio
O que as referências de texto devem evitar:
- Descrições visuais redundantes que já estão visíveis na sua imagem de referência
- Linguagem emocional abstrata, como "melancólico" ou "esperançoso", sem uma âncora de movimento concreta
- Mais de um evento de ação principal dentro de um mesmo clipe
Seu primeiro fluxo de trabalho no Seedance 2.5
Este é um processo de três etapas que você pode repetir com qualquer material de origem, qualquer sujeito e qualquer intenção de movimento.
Etapa 1: prepare sua imagem de origem
Comece com uma única imagem que tenha um sujeito claro e iluminação limpa e direcional. Se você estiver gerando a imagem de referência em vez de usar uma fotografia, o fluxo Wan 2.7 I2V produz imagens de primeiro quadro de boa qualidade, feitas para animação. Para o seu primeiro fluxo, uma fotografia real é mais previsível, porque não há artefatos de geração para contornar.
Recorte a imagem em 16:9. Remova textos sobrepostos ou marcas d’água. Confirme que o sujeito está centralizado ou posicionado segundo a regra dos terços, com separação clara do fundo. Salve em JPG ou PNG de alta qualidade, em resolução total.

Etapa 2: escreva o prompt de movimento
Abra um bloco de notas e escreva uma frase para cada um dos quatro elementos de movimento: ação do sujeito, movimento de câmera, detalhe do ambiente e atmosfera sonora. Escreva-as separadamente primeiro e depois combine-as em um parágrafo fluido.
Leia o prompt combinado em voz alta. Se soar como um diretor de cinema instruindo um diretor de fotografia, está pronto. Se soar como uma descrição de produto ou uma descrição visual, precisa de mais especificidade sobre o movimento.
Prompt fraco: "Um vídeo cinematográfico de uma rua da cidade à noite com boa iluminação."
Prompt mais forte: "Um homem de casaco escuro se afasta da câmera por uma rua molhada da cidade. A câmera permanece parada. Reflexos de neon ondulam nas poças de chuva sobre o asfalto. Ruído de trânsito distante, uma chuva fina e um único carro passando da direita para a esquerda ao fundo."
A versão mais forte especifica o quadro fixo exato da câmera, o movimento preciso do sujeito e o som exato, mesmo que o estilo visual dos reflexos de neon e da rua molhada já esteja implícito em uma imagem de referência forte.

Etapa 3: execute e avalie
Envie sua referência de imagem e o prompt de texto para o Seedance 2.5. Quando o resultado chegar, avalie-o em três eixos distintos:
- Fidelidade visual: o resultado corresponde à paleta de cores e à composição da sua imagem de referência?
- Coerência de movimento: o sujeito se move da forma descrita no seu prompt de texto?
- Estabilidade temporal: o resultado se mantém coerente durante toda a duração, sem cintilação, geometria derretida ou artefatos visuais?
Se a fidelidade visual falhar, o problema está na sua imagem de referência. Se a coerência de movimento falhar, o problema está no seu prompt de texto. Se a estabilidade temporal falhar, tente simplificar o movimento no prompt de texto ou usar uma imagem de referência visualmente menos complexa.
Essa lista de verificação em três eixos torna muito mais rápido identificar qual entrada precisa de ajuste, em vez de reescrever as duas ao mesmo tempo sem saber o que mudou.

Erros comuns de iniciantes
Dois erros explicam a maior parte dos resultados ruins de novos usuários do Seedance 2.5.
Sinais visuais conflitantes
A falha mais comum é usar uma imagem de referência e um prompt de texto que descrevem ambientes visuais diferentes. O modelo tenta atender às duas entradas, e o resultado geralmente mistura as duas de formas que parecem irreais ou incoerentes.
Exemplo de conflito: a imagem de referência mostra um escritório interno, claro e iluminado pela luz do dia. O prompt de texto inclui "letreiros de neon brilhando na chuva da cidade". O modelo não consegue conciliar a luz do dia interna com o neon externo, e o resultado costuma produzir um híbrido que não se encaixa convincentemente em nenhum dos dois ambientes.
A correção é simples: deixe a imagem definir totalmente o ambiente visual e remova do texto qualquer descrição de ambiente que não esteja presente na imagem. Se sua imagem é um espaço interno, seu prompt deve descrever movimentos que acontecem em ambientes internos. Se sua imagem é uma floresta, seu prompt deve descrever o que se move dentro dessa floresta.
Prompts sobrecarregados
Iniciantes tendem a escrever prompts com eventos demais numa única geração. Os clipes do Seedance 2.5 duram de 5 a 30 segundos. Nessa janela, uma ação pode ser representada de forma convincente. Duas ações começam a disputar a atenção. Três ações normalmente não resultam em nenhuma delas bem representada.
💡 Um sujeito. Uma ação principal. Um movimento de câmera. Essa estrutura produz os resultados mais estáveis no tempo, especialmente quando combinada com uma imagem de referência forte. Resista à vontade de incluir um arco narrativo completo em uma única geração.
Se você precisar de uma sequência com vários eventos, gere cada um como um clipe próprio, com sua própria imagem de referência, e depois combine os clipes em um editor de vídeo. A qualidade de cada clipe individual será maior, e a sequência final parecerá mais controlada.

Como usar o Seedance 2.5 no PicassoIA
O PicassoIA oferece tanto o Seedance 2.5 quanto o Seedance 2.5 Lite, gratuito, dando a você opções conforme esteja iterando rapidamente ou produzindo resultados de qualidade final.
Configurando a geração
- Acesse o Seedance 2.5 no PicassoIA
- Envie sua imagem de referência preparada no painel de entrada de imagem
- Cole seu prompt de movimento no campo de texto
- Selecione a duração desejada do clipe entre 5 e 30 segundos
- Clique em Gerar e aguarde o resultado
A plataforma processa a parte multimodal automaticamente. Você não precisa indicar qual parte da entrada é visual e qual é de movimento. Os dois campos são distintos na interface, e o modelo os lê separadamente.
Lendo e iterando sobre os resultados
Quando o primeiro resultado chegar, assista a ele duas vezes. Primeira passagem: avalie a fidelidade visual em relação à sua imagem de referência. Segunda passagem: avalie a coerência de movimento em relação ao seu prompt de texto. Faça anotações por escrito antes de executar uma segunda geração.
A abordagem de iteração mais eficaz é mudar exatamente uma coisa por vez. Troque a imagem de referência mantendo o texto, ou ajuste uma frase do texto mantendo a mesma imagem. Alterar as duas entradas ao mesmo tempo torna impossível identificar o que causou qualquer melhora ou regressão. Uma variável, uma geração, uma avaliação.
Para trabalhos de maior volume, o Seedance 1.5 Pro e o Seedance 2.0 aceitam a mesma estrutura de referência multimodal. O fluxo de trabalho se transfere diretamente entre as versões do modelo, então a experiência com uma delas beneficia imediatamente seus resultados nas outras.

Modelos que valem a comparação
Depois que seu fluxo de referências multimodais estiver bem ajustado com o Seedance 2.5, vale saber como outros modelos do PicassoIA lidam com entradas semelhantes. A escolha certa muda conforme a sua prioridade.
Quando usar o Seedance 2.5 ou as alternativas
Para identidade de sujeito consistente em vários clipes: o Kling v3 Omni Video lida muito bem com a coerência de rosto e corpo quando você precisa que o mesmo personagem apareça de forma consistente em uma série de clipes.
Para saídas mais longas: o Seedance 2.5 suporta até 30 segundos, mais do que muitas alternativas da plataforma. O Veo 3.1 compete nessa duração com alto fotorrealismo, mas processa mais devagar, o que o torna mais adequado para renderizações finais do que para iteração rápida.
Para iteração rápida com custo menor: o Seedance 2.5 Lite e o Ray Flash 2 720p geram resultados mais rápidos, o que os torna práticos para testar combinações de referência antes de partir para uma execução de qualidade total no modelo principal.
Para controle de região de movimento: o Wan 2.7 I2V oferece controle mais granular sobre quais partes da imagem de referência devem se mover, útil quando só uma região específica do quadro precisa de animação enquanto o restante permanece estático.
Para qualidade de áudio nativo: o Hailuo 2.3 produz áudio sincronizado particularmente forte, o que vale considerar quando o design sonoro do clipe é tão importante quanto o resultado visual.
A abordagem prática para qualquer projeto novo é rodar a mesma imagem de referência e o mesmo prompt de texto por dois ou três modelos em uma única sessão, comparar os resultados pelos três eixos de avaliação (fidelidade visual, coerência de movimento e estabilidade temporal) e escalar a produção com o modelo que se sai melhor para aquele tipo específico de conteúdo. O que funciona para um retrato pode não funcionar tão bem para uma paisagem, e vice-versa.
Comece a criar seus próprios vídeos
O fluxo de referências multimodais no Seedance 2.5 não é complicado depois que você internaliza sua estrutura. Prepare uma imagem de referência limpa. Escreva um prompt de texto focado em movimento, em quatro partes. Avalie o resultado pelos três eixos. Ajuste uma entrada por vez. Repita até que o resultado corresponda à sua intenção.
Esse ciclo, quando se torna algo natural, faz a geração de vídeo com IA parecer menos um jogo de adivinhação e mais um processo de produção controlado. A qualidade dos seus resultados melhora sem aumentar o tempo que você gasta por geração, porque cada execução carrega as informações da anterior.
O PicassoIA dá acesso ao Seedance 2.5 e ao Seedance 2.5 Lite, junto com dezenas de outros modelos de geração de vídeo que abrangem controle de movimento, animação de rostos, síntese de áudio e upscaling em alta resolução. Você pode testar o mesmo fluxo de referências em vários modelos em uma única sessão, comparar os resultados diretamente e escalar a abordagem que funciona.
Se você já tem uma imagem de referência pronta, a forma mais rápida de ver o que a geração multimodal realmente produz é enviá-la, escrever uma frase clara de movimento e executar. Assista ao resultado uma vez para a fidelidade visual e outra para o movimento. Mude uma coisa. Execute de novo. Os resultados evoluem rápido a partir daí, e o fluxo que você desenvolve nas primeiras sessões vai acompanhar todos os projetos seguintes.
Acesse picassoia.com/en/all-models para ver a gama completa de modelos de geração de vídeo disponíveis e encontrar o que atende às suas necessidades específicas de produção.