Se você tem uma pasta de fotos de referência e uma ideia clara do que deve acontecer em uma cena, o recurso Ingredients to Video do Veo 3.1 foi criado exatamente para esse momento. Em vez de depender totalmente de descrições em texto para definir o estilo visual, a aparência do sujeito e o clima, você pode dar ao modelo uma imagem de referência e deixar que ele faça o trabalho pesado. O resultado é um vídeo que realmente parece com a cena que você tinha em mente.

O que o "Ingredients to Video" realmente faz
O nome é intencional. "Ingredients" sinaliza que suas entradas, incluindo a imagem de referência e o seu prompt de texto, são matérias-primas que o modelo combina para produzir o resultado. O Veo 3.1 não se limita a animar uma foto estática. Ele usa a informação visual dentro da referência como âncora de composição e então gera movimento que se estende de forma natural a partir desse ponto de partida.
Isso é fundamentalmente diferente das ferramentas de imagem para vídeo que apenas acrescentam um movimento sutil a uma foto. O Veo 3.1 sintetiza novos quadros com base no que infere sobre iluminação, profundidade, relações espaciais e características do sujeito a partir da referência. O vídeo produzido pode mostrar movimento de câmera, ações do sujeito e detalhes do ambiente que nunca estiveram na imagem original.
O papel das imagens de referência
Neste contexto, uma imagem de referência não é simplesmente um primeiro quadro. É um documento de especificação visual. O Veo 3.1 a analisa para:
- Identidade do sujeito: estrutura do rosto, proporções do corpo, tom de pele, textura do cabelo
- Condições de iluminação: direção, dureza, temperatura de cor
- Tipo de ambiente: interior, exterior, natural, urbano
- Paleta de cores: os tons dominantes e de destaque que se mantêm no vídeo gerado
- Profundidade de campo aparente: caráter do bokeh, pistas de distância focal
Quanto mais informação sua imagem de referência contiver, com mais precisão o Veo 3.1 pode calibrar o resultado. Um retrato nítido e bem iluminado dá ao modelo mais com que trabalhar do que um instantâneo borrado de celular.
Como o Veo 3.1 lê o contexto visual
O Google DeepMind treinou o Veo 3.1 em grandes conjuntos de dados de vídeo, o que significa que ele tem fortes noções prévias sobre como as cenas evoluem ao longo do tempo. Quando uma imagem de referência mostra uma mulher perto de uma janela com luz da tarde, o modelo sabe que essa situação de iluminação produz movimentos específicos de sombra com a passagem do tempo, reflexos específicos na pele e no tecido e mudanças específicas nas cores do ambiente. Esse conhecimento contextual é o que separa o Veo 3.1 de ferramentas de animação mais simples.
💡 Dica de especialista: imagens de referência com iluminação direcional forte produzem o vídeo visualmente mais coerente. Uma luz difusa e nublada dá ao modelo menos com que trabalhar.

Por que as imagens de referência mudam tudo
Os prompts de texto, por si só, têm uma limitação fundamental: as palavras descrevem conceitos, não detalhes. Você pode escrever "uma mulher com cabelo castanho quente sob a luz dourada do fim da tarde" e o modelo fará uma suposição sobre como isso se parece. Acrescente uma imagem de referência da pessoa, da cena e da iluminação exatas, e essa suposição se estreita de forma significativa.
Consistência sem truques de prompt
Uma das frustrações mais persistentes na geração de vídeo com IA é a consistência. Gerar um segundo clipe com o mesmo personagem, o mesmo local e a mesma iluminação do primeiro exige engenharia de prompt precisa, e mesmo assim os resultados variam. As imagens de referência resolvem grande parte desse problema.
Quando você usa a mesma imagem de referência em várias gerações do Veo 3.1, o modelo ancora cada resultado à mesma impressão visual. A pessoa da sua referência terá o mesmo rosto, o cômodo terá a mesma temperatura de cor e a luz virá da mesma direção. Isso torna a geração de vídeo guiada por referência a abordagem mais prática para quem produz uma série de clipes.
Transferência de estilo em movimento
As imagens de referência também funcionam como referências de estilo, não apenas de sujeito. Forneça uma fotografia com um visual cinematográfico específico, uma gradação de cor específica ou um estilo de composição específico, e o Veo 3.1 leva essas qualidades para os quadros de vídeo que gera. É assim que cineastas e criadores de conteúdo usam os painéis de referência na produção tradicional: para estabelecer uma linguagem visual antes de a filmagem começar.
A mesma lógica se aplica aqui. Sua imagem de referência é o seu documento de linguagem visual.
Casos de uso reais que funcionam
| Caso de uso | O que você fornece | O que o Veo 3.1 gera |
|---|
| Campanha de moda | Foto de modelo com um look específico | Clipe de 5 segundos com movimento natural |
| Showcase de produto | Foto de produto vista de cima ou foto de destaque',' | Revelação orbital com iluminação cinematográfica |
| Conteúdo de viagem | Foto de paisagem do destino | Panorâmica cinematográfica com movimento atmosférico |
| Avatar para redes sociais | Retrato com um visual específico | Loop suave com micro-movimento natural |
| Imóveis | Foto de um cômodo interno | Avanço suave da câmera pelo espaço |

Como usar o Veo 3.1 no PicassoIA
O Veo 3.1 está disponível diretamente no PicassoIA, sem nenhuma configuração de API nem instalação local. Aqui está o fluxo exato para usá-lo com imagens de referência.
Passo 1: escolha sua imagem de referência
Antes de abrir a ferramenta, dedique um tempo para selecionar a referência certa. As qualidades que mais importam são:
- Resolução: 1024px ou mais no lado menor. Resolução mais alta dá ao modelo mais detalhes para extrair.
- Nitidez: foco preciso no seu sujeito principal. Desfoque de movimento na referência cria ambiguidade.
- Composição: enquadre o seu sujeito do jeito que você quer que ele apareça no vídeo.
- Iluminação: escolha uma imagem de referência que tenha a iluminação que você quer no vídeo final. O modelo não vai inventar uma iluminação melhor do que a que você fornecer.
Evite usar capturas de tela de redes sociais. Artefatos de compressão e marcas d’água introduzem ruído na leitura da imagem feita pelo modelo.
Passo 2: monte o prompt
Com o Veo 3.1, seu prompt de texto deve focar em movimento e ação, não em aparência. A imagem de referência cuida da aparência. Seu prompt deve responder: o que acontece nesta cena?
Estruturas de prompt eficazes:
- Ação primeiro: "Caminhando devagar por um jardim iluminado pelo sol, folhas caindo ao redor dela, uma brisa suave movendo o cabelo"
- Câmera primeiro: "Travelling lento para a frente entrando no cômodo, a profundidade de campo mudando o foco do objeto em primeiro plano para o sujeito"
- Atmosfera primeiro: "Luz do amanhecer clareando gradualmente, névoa subindo da grama, pássaros cruzando o quadro"
Mantenha os prompts entre 30 e 80 palavras. O Veo 3.1 processa prompts mais longos, mas os curtos e específicos produzem resultados mais precisos.
Passo 3: configure e execute
No PicassoIA, a interface do Veo 3.1 oferece os parâmetros principais:
| Parâmetro | Configuração recomendada | Observações |
|---|
| Imagem de referência | Sua foto selecionada | Envie diretamente do dispositivo |
| Prompt | Descrição focada em movimento | 30-80 palavras |
| Duração | 5-8 segundos | Ideal para uso em redes sociais e web |
| Proporção | 16:9 ou 9:16 | Combine com a plataforma de publicação |
| Seed | Valor fixo | Use a mesma seed para execuções consistentes |
Clique em gerar e aguarde. O Veo 3.1 normalmente leva de 60 a 120 segundos por geração.
💡 Salve seu seed: se você obtiver um resultado de que gostou, anote o valor do seed antes de fechar. Você pode usar o mesmo seed com pequenas variações no prompt para produzir séries de resultados coerentes.
O que esperar dos resultados
As primeiras gerações raramente são os resultados finais. Use a primeira execução para avaliar se o modelo leu a referência corretamente. Verifique:
- Interpretação correta do sujeito: a pessoa ou o objeto no vídeo corresponde à sua referência?
- Continuidade da iluminação: a direção da luz e a temperatura de cor são consistentes com a referência?
- Naturalidade do movimento: o movimento parece fisicamente plausível?
Se o sujeito parecer errado, a imagem de referência pode estar ambígua demais. Se a iluminação estiver fora do lugar, seu prompt pode estar sobrepondo a referência. Ajuste e execute novamente.

A combinação de uma imagem de referência com um prompt de texto cria uma pequena tensão: o modelo precisa conciliar duas fontes de informação. Saber como ele resolve essa tensão ajuda você a escrever prompts melhores.
Descreva o movimento, não a aparência
Esta é a regra mais importante para a geração guiada por referência. Se a sua referência mostra uma mulher com um vestido vermelho e o seu prompt diz "mulher com um vestido vermelho caminhando", você está descrevendo de forma redundante o que a referência já comunica. Pior ainda, se o prompt disser "mulher com um vestido azul caminhando", você cria um conflito que produz um resultado imprevisível.
Escreva os prompts como se o modelo já visse exatamente quem e o que está na referência. Descreva o que a pessoa ou coisa faz, não como ela é.
3 estruturas de prompt que funcionam bem
Estrutura 1: sujeito + movimento + ambiente
"Vira devagar para olhar por cima do ombro, um leve sorriso se formando, vento quente da tarde movendo o tecido"
Estrutura 2: movimento de câmera + ponto focal
"A câmera sobe devagar da altura da mesa até a altura dos olhos, revelando todo o estúdio atrás do sujeito, com profundidade de campo rasa do início ao fim"
Estrutura 3: atmosfera + passagem do tempo
"A luz da manhã se intensifica ao longo de 5 segundos, as sombras girando levemente, o vapor da xícara se dissipando no ar"
O que evitar no seu prompt de texto
- Descrições de aparência que entrem em conflito com a imagem de referência
- Palavras vagas de estilo, como "cinematográfico" ou "fotorrealista", porque a imagem de referência já define o estilo
- Palavras vagas de movimento, como "movimento natural": seja específico sobre o que se move e como
- Prompts longos demais com várias instruções concorrentes
💡 Resolução de conflitos: quando o seu prompt e a imagem de referência entram em conflito, o Veo 3.1 geralmente dá mais peso à imagem de referência para a aparência do sujeito e mais peso ao prompt para a direção do movimento. Use isso a seu favor, de forma previsível.

Veo 3.1 ou outros modelos de imagem para vídeo
O PicassoIA tem mais de 87 modelos de geração de vídeo. Escolher o certo para trabalhar com imagens de referência exige saber em que cada um se destaca.
Veo 3.1 ou Kling V3
O Kling V3 é um forte concorrente para vídeo guiado por referência. Ele lida bem com movimentos complexos e produz clipes mais longos com precisão física impressionante. O Veo 3.1 leva a melhor na fidelidade de iluminação, especificamente em como preserva o caráter de luz da imagem de referência. Para trabalhos de retrato e moda, em que o tom de pele e a direção da luz são decisivos, o Veo 3.1 é a escolha mais confiável.
Veo 3.1 ou Wan 2.6 i2v
O Wan 2.6 Image-to-Video é mais rápido e geralmente mais acessível por geração. É excelente para animações simples em que a imagem de referência funciona como um primeiro quadro literal. O Ingredients to Video do Veo 3.1 é a melhor escolha quando você quer que o modelo gere um vídeo que vai além do conteúdo literal da referência, criando cenas que a referência apenas sugeria.
Quando escolher o Veo 3.1 Fast
O Veo 3.1 Fast é a versão indicada quando você está iterando rapidamente por variações. Ele tem tempos de geração menores, ao custo de uma pequena perda de qualidade. O fluxo de trabalho que a maioria dos profissionais usa: iterar com o Veo 3.1 Fast até que a interpretação da referência e o movimento estejam corretos, e então executar a saída final no Veo 3.1 para a máxima qualidade.
| Modelo | Melhor para | Velocidade | Fidelidade à referência |
|---|
| Veo 3.1 | Saídas finais, trabalhos em que a iluminação é crítica | Média | Muito alta |
| Veo 3.1 Fast | Iteração e testes | Rápida | Alta |
| Kling V3 | Clipes longos, movimentos complexos | Média | Alta |
| Wan 2.6 i2v | Animação rápida, eficiência de custo | Rápida | Média |

A maioria das gerações fracassadas se deve a um de três problemas de entrada, não a limitações do modelo.
Entradas de baixa resolução
Enviar uma imagem de referência comprimida ou pequena é a forma mais rápida de obter resultados inconsistentes. Quando o modelo não consegue resolver detalhes finos na referência, ele preenche as lacunas com as próprias noções prévias. O resultado é um vídeo que captura o clima geral da referência, mas não os seus detalhes. Seu sujeito parece diferente. A luz está no lugar errado.
Recomendação mínima: 1024x576px para conteúdo 16:9. Busque 1920x1080px quando o detalhe do sujeito for importante.
Prompts conflitantes
Um prompt que descreve a aparência do sujeito muitas vezes vai sobrepor ou diluir a influência da imagem de referência. Isso acontece porque o Veo 3.1 recebe os dois como instruções e precisa ponderar entre eles. Quanto mais específica e detalhada for a descrição da aparência, mais ela afasta o modelo da referência.
A correção é simples: remova toda linguagem de aparência do seu prompt e substitua-a apenas por linguagem de movimento.
Ignorar a proporção
A imagem de referência e o vídeo de saída devem ter a mesma proporção. Enviar um retrato quadrado 1:1 como referência e pedir uma saída 16:9 obriga o modelo a inventar o que existe fora do quadro. Às vezes isso funciona. Com frequência, produz proporções distorcidas ou uma extrapolação incorreta do ambiente.
Recorte sua referência na proporção de saída pretendida antes de enviá-la.

O que você pode criar agora
A geração de vídeo guiada por referência com o Veo 3.1 não é teórica. Estes são tipos de conteúdo específicos que produzem bons resultados nesse fluxo de trabalho hoje.
Conteúdo de moda e estilo de vida
É aqui que a tecnologia é mais útil de imediato. Marcas de moda e criadores de estilo de vida precisam de vídeos de produtos específicos em pessoas específicas e em cenários específicos. A geração guiada por referência permite partir de fotografias já existentes, gravar menos horas e produzir mais conteúdo.
Uma única fotografia de moda de alta qualidade vira um clipe de 5 segundos, um estudo de textura em close e um vídeo de estilo de vida ao ar livre, tudo com consistência visual em cada resultado.
Vídeos de viagem e destinos
Produtores de conteúdo de viagem costumam ter fotografias de locais, mas precisam de vídeo. A geração guiada por referência preenche essa lacuna. Uma fotografia de paisagem vira uma panorâmica lenta e cinematográfica. Um interior arquitetônico vira um avanço suave pelo espaço. A referência ancora o modelo nos detalhes visuais do local real, em vez de uma interpretação genérica da cena.
Clipes de vitrine de produtos
Marcas de e-commerce precisam de vídeo de produto, mas nem sempre têm orçamento para uma produção completa. Uma foto de destaque do produto como imagem de referência, combinada com um prompt de movimento de rotação ou revelação, produz um vídeo de produto utilizável que combina com a fotografia já existente da marca. A cor, a iluminação e o tratamento do fundo da referência passam diretamente para o vídeo.

A forma mais rápida de ver o que o Ingredients to Video do Veo 3.1 faz é testá-lo você mesmo. Escolha uma fotografia que você já tenha, com iluminação clara e um sujeito nítido. Escreva um prompt curto, em uma frase, descrevendo o que deve acontecer na cena. Envie os dois para o Veo 3.1 no PicassoIA e execute sua primeira geração.
O primeiro resultado vai mostrar mais sobre como as imagens de referência interagem com este modelo do que qualquer explicação escrita. A partir daí, ajuste a seleção de referências, refine o prompt, experimente o Veo 3.1 Fast para ciclos de iteração mais rápidos e compare resultados com o Kling V3 ou o Wan 2.6 i2v para descobrir o que atende às suas necessidades específicas de conteúdo.
O PicassoIA dá acesso a todos esses modelos em um só lugar, então você pode rodar a mesma referência em vários sistemas e comparar os resultados lado a lado. Essa comparação direta é o circuito de feedback mais preciso para desenvolver intuição sobre geração de vídeo com IA usando imagens de referência.
