Veo 3.1 Ingredients to Video: use imagens de referência para vídeo com IA

O Ingredients to Video do Veo 3.1 permite usar imagens de referência para ancorar cada detalhe visual do seu vídeo gerado por IA, desde a iluminação e as cores até a identidade do sujeito. Este artigo explica exatamente como o recurso funciona, como usá-lo passo a passo no PicassoIA e como escrever prompts que gerem resultados consistentes e de alta qualidade em várias gerações.

Veo 3.1 Ingredients to Video: use imagens de referência para vídeo com IA
Cristian Da Conceicao
Fundador do Picasso IA

Se você tem uma pasta de fotos de referência e uma ideia clara do que deve acontecer em uma cena, o recurso Ingredients to Video do Veo 3.1 foi criado exatamente para esse momento. Em vez de depender totalmente de descrições em texto para definir o estilo visual, a aparência do sujeito e o clima, você pode dar ao modelo uma imagem de referência e deixar que ele faça o trabalho pesado. O resultado é um vídeo que realmente parece com a cena que você tinha em mente.

Fotos de referência dispostas em um quadro de cortiça pronto para a geração de vídeo com IA

O que o "Ingredients to Video" realmente faz

O nome é intencional. "Ingredients" sinaliza que suas entradas, incluindo a imagem de referência e o seu prompt de texto, são matérias-primas que o modelo combina para produzir o resultado. O Veo 3.1 não se limita a animar uma foto estática. Ele usa a informação visual dentro da referência como âncora de composição e então gera movimento que se estende de forma natural a partir desse ponto de partida.

Isso é fundamentalmente diferente das ferramentas de imagem para vídeo que apenas acrescentam um movimento sutil a uma foto. O Veo 3.1 sintetiza novos quadros com base no que infere sobre iluminação, profundidade, relações espaciais e características do sujeito a partir da referência. O vídeo produzido pode mostrar movimento de câmera, ações do sujeito e detalhes do ambiente que nunca estiveram na imagem original.

O papel das imagens de referência

Neste contexto, uma imagem de referência não é simplesmente um primeiro quadro. É um documento de especificação visual. O Veo 3.1 a analisa para:

  • Identidade do sujeito: estrutura do rosto, proporções do corpo, tom de pele, textura do cabelo
  • Condições de iluminação: direção, dureza, temperatura de cor
  • Tipo de ambiente: interior, exterior, natural, urbano
  • Paleta de cores: os tons dominantes e de destaque que se mantêm no vídeo gerado
  • Profundidade de campo aparente: caráter do bokeh, pistas de distância focal

Quanto mais informação sua imagem de referência contiver, com mais precisão o Veo 3.1 pode calibrar o resultado. Um retrato nítido e bem iluminado dá ao modelo mais com que trabalhar do que um instantâneo borrado de celular.

Como o Veo 3.1 lê o contexto visual

O Google DeepMind treinou o Veo 3.1 em grandes conjuntos de dados de vídeo, o que significa que ele tem fortes noções prévias sobre como as cenas evoluem ao longo do tempo. Quando uma imagem de referência mostra uma mulher perto de uma janela com luz da tarde, o modelo sabe que essa situação de iluminação produz movimentos específicos de sombra com a passagem do tempo, reflexos específicos na pele e no tecido e mudanças específicas nas cores do ambiente. Esse conhecimento contextual é o que separa o Veo 3.1 de ferramentas de animação mais simples.

💡 Dica de especialista: imagens de referência com iluminação direcional forte produzem o vídeo visualmente mais coerente. Uma luz difusa e nublada dá ao modelo menos com que trabalhar.

Homem segurando uma fotografia de referência enquanto o notebook exibe a interface de vídeo com IA

Por que as imagens de referência mudam tudo

Os prompts de texto, por si só, têm uma limitação fundamental: as palavras descrevem conceitos, não detalhes. Você pode escrever "uma mulher com cabelo castanho quente sob a luz dourada do fim da tarde" e o modelo fará uma suposição sobre como isso se parece. Acrescente uma imagem de referência da pessoa, da cena e da iluminação exatas, e essa suposição se estreita de forma significativa.

Consistência sem truques de prompt

Uma das frustrações mais persistentes na geração de vídeo com IA é a consistência. Gerar um segundo clipe com o mesmo personagem, o mesmo local e a mesma iluminação do primeiro exige engenharia de prompt precisa, e mesmo assim os resultados variam. As imagens de referência resolvem grande parte desse problema.

Quando você usa a mesma imagem de referência em várias gerações do Veo 3.1, o modelo ancora cada resultado à mesma impressão visual. A pessoa da sua referência terá o mesmo rosto, o cômodo terá a mesma temperatura de cor e a luz virá da mesma direção. Isso torna a geração de vídeo guiada por referência a abordagem mais prática para quem produz uma série de clipes.

Transferência de estilo em movimento

As imagens de referência também funcionam como referências de estilo, não apenas de sujeito. Forneça uma fotografia com um visual cinematográfico específico, uma gradação de cor específica ou um estilo de composição específico, e o Veo 3.1 leva essas qualidades para os quadros de vídeo que gera. É assim que cineastas e criadores de conteúdo usam os painéis de referência na produção tradicional: para estabelecer uma linguagem visual antes de a filmagem começar.

A mesma lógica se aplica aqui. Sua imagem de referência é o seu documento de linguagem visual.

Casos de uso reais que funcionam

Caso de usoO que você forneceO que o Veo 3.1 gera
Campanha de modaFoto de modelo com um look específicoClipe de 5 segundos com movimento natural
Showcase de produtoFoto de produto vista de cima ou foto de destaque','Revelação orbital com iluminação cinematográfica
Conteúdo de viagemFoto de paisagem do destinoPanorâmica cinematográfica com movimento atmosférico
Avatar para redes sociaisRetrato com um visual específicoLoop suave com micro-movimento natural
ImóveisFoto de um cômodo internoAvanço suave da câmera pelo espaço

Tela dividida mostrando a foto de referência ao lado de quadros de vídeo gerados por IA

Como usar o Veo 3.1 no PicassoIA

O Veo 3.1 está disponível diretamente no PicassoIA, sem nenhuma configuração de API nem instalação local. Aqui está o fluxo exato para usá-lo com imagens de referência.

Passo 1: escolha sua imagem de referência

Antes de abrir a ferramenta, dedique um tempo para selecionar a referência certa. As qualidades que mais importam são:

  • Resolução: 1024px ou mais no lado menor. Resolução mais alta dá ao modelo mais detalhes para extrair.
  • Nitidez: foco preciso no seu sujeito principal. Desfoque de movimento na referência cria ambiguidade.
  • Composição: enquadre o seu sujeito do jeito que você quer que ele apareça no vídeo.
  • Iluminação: escolha uma imagem de referência que tenha a iluminação que você quer no vídeo final. O modelo não vai inventar uma iluminação melhor do que a que você fornecer.

Evite usar capturas de tela de redes sociais. Artefatos de compressão e marcas d’água introduzem ruído na leitura da imagem feita pelo modelo.

Passo 2: monte o prompt

Com o Veo 3.1, seu prompt de texto deve focar em movimento e ação, não em aparência. A imagem de referência cuida da aparência. Seu prompt deve responder: o que acontece nesta cena?

Estruturas de prompt eficazes:

  1. Ação primeiro: "Caminhando devagar por um jardim iluminado pelo sol, folhas caindo ao redor dela, uma brisa suave movendo o cabelo"
  2. Câmera primeiro: "Travelling lento para a frente entrando no cômodo, a profundidade de campo mudando o foco do objeto em primeiro plano para o sujeito"
  3. Atmosfera primeiro: "Luz do amanhecer clareando gradualmente, névoa subindo da grama, pássaros cruzando o quadro"

Mantenha os prompts entre 30 e 80 palavras. O Veo 3.1 processa prompts mais longos, mas os curtos e específicos produzem resultados mais precisos.

Passo 3: configure e execute

No PicassoIA, a interface do Veo 3.1 oferece os parâmetros principais:

ParâmetroConfiguração recomendadaObservações
Imagem de referênciaSua foto selecionadaEnvie diretamente do dispositivo
PromptDescrição focada em movimento30-80 palavras
Duração5-8 segundosIdeal para uso em redes sociais e web
Proporção16:9 ou 9:16Combine com a plataforma de publicação
SeedValor fixoUse a mesma seed para execuções consistentes

Clique em gerar e aguarde. O Veo 3.1 normalmente leva de 60 a 120 segundos por geração.

💡 Salve seu seed: se você obtiver um resultado de que gostou, anote o valor do seed antes de fechar. Você pode usar o mesmo seed com pequenas variações no prompt para produzir séries de resultados coerentes.

O que esperar dos resultados

As primeiras gerações raramente são os resultados finais. Use a primeira execução para avaliar se o modelo leu a referência corretamente. Verifique:

  • Interpretação correta do sujeito: a pessoa ou o objeto no vídeo corresponde à sua referência?
  • Continuidade da iluminação: a direção da luz e a temperatura de cor são consistentes com a referência?
  • Naturalidade do movimento: o movimento parece fisicamente plausível?

Se o sujeito parecer errado, a imagem de referência pode estar ambígua demais. Se a iluminação estiver fora do lugar, seu prompt pode estar sobrepondo a referência. Ajuste e execute novamente.

Parede com painel de inspiração coberta de fotografias de referência

Dicas de prompt que funcionam com imagens de referência

A combinação de uma imagem de referência com um prompt de texto cria uma pequena tensão: o modelo precisa conciliar duas fontes de informação. Saber como ele resolve essa tensão ajuda você a escrever prompts melhores.

Descreva o movimento, não a aparência

Esta é a regra mais importante para a geração guiada por referência. Se a sua referência mostra uma mulher com um vestido vermelho e o seu prompt diz "mulher com um vestido vermelho caminhando", você está descrevendo de forma redundante o que a referência já comunica. Pior ainda, se o prompt disser "mulher com um vestido azul caminhando", você cria um conflito que produz um resultado imprevisível.

Escreva os prompts como se o modelo já visse exatamente quem e o que está na referência. Descreva o que a pessoa ou coisa faz, não como ela é.

3 estruturas de prompt que funcionam bem

Estrutura 1: sujeito + movimento + ambiente "Vira devagar para olhar por cima do ombro, um leve sorriso se formando, vento quente da tarde movendo o tecido"

Estrutura 2: movimento de câmera + ponto focal "A câmera sobe devagar da altura da mesa até a altura dos olhos, revelando todo o estúdio atrás do sujeito, com profundidade de campo rasa do início ao fim"

Estrutura 3: atmosfera + passagem do tempo "A luz da manhã se intensifica ao longo de 5 segundos, as sombras girando levemente, o vapor da xícara se dissipando no ar"

O que evitar no seu prompt de texto

  • Descrições de aparência que entrem em conflito com a imagem de referência
  • Palavras vagas de estilo, como "cinematográfico" ou "fotorrealista", porque a imagem de referência já define o estilo
  • Palavras vagas de movimento, como "movimento natural": seja específico sobre o que se move e como
  • Prompts longos demais com várias instruções concorrentes

💡 Resolução de conflitos: quando o seu prompt e a imagem de referência entram em conflito, o Veo 3.1 geralmente dá mais peso à imagem de referência para a aparência do sujeito e mais peso ao prompt para a direção do movimento. Use isso a seu favor, de forma previsível.

Mulher de perfil examinando os resultados de vídeo gerados por IA em um monitor grande

Veo 3.1 ou outros modelos de imagem para vídeo

O PicassoIA tem mais de 87 modelos de geração de vídeo. Escolher o certo para trabalhar com imagens de referência exige saber em que cada um se destaca.

Veo 3.1 ou Kling V3

O Kling V3 é um forte concorrente para vídeo guiado por referência. Ele lida bem com movimentos complexos e produz clipes mais longos com precisão física impressionante. O Veo 3.1 leva a melhor na fidelidade de iluminação, especificamente em como preserva o caráter de luz da imagem de referência. Para trabalhos de retrato e moda, em que o tom de pele e a direção da luz são decisivos, o Veo 3.1 é a escolha mais confiável.

Veo 3.1 ou Wan 2.6 i2v

O Wan 2.6 Image-to-Video é mais rápido e geralmente mais acessível por geração. É excelente para animações simples em que a imagem de referência funciona como um primeiro quadro literal. O Ingredients to Video do Veo 3.1 é a melhor escolha quando você quer que o modelo gere um vídeo que vai além do conteúdo literal da referência, criando cenas que a referência apenas sugeria.

Quando escolher o Veo 3.1 Fast

O Veo 3.1 Fast é a versão indicada quando você está iterando rapidamente por variações. Ele tem tempos de geração menores, ao custo de uma pequena perda de qualidade. O fluxo de trabalho que a maioria dos profissionais usa: iterar com o Veo 3.1 Fast até que a interpretação da referência e o movimento estejam corretos, e então executar a saída final no Veo 3.1 para a máxima qualidade.

ModeloMelhor paraVelocidadeFidelidade à referência
Veo 3.1Saídas finais, trabalhos em que a iluminação é críticaMédiaMuito alta
Veo 3.1 FastIteração e testesRápidaAlta
Kling V3Clipes longos, movimentos complexosMédiaAlta
Wan 2.6 i2vAnimação rápida, eficiência de custoRápidaMédia

Vista aérea de fotografias de referência selecionadas sobre uma superfície de linho

Erros comuns com imagens de referência

A maioria das gerações fracassadas se deve a um de três problemas de entrada, não a limitações do modelo.

Entradas de baixa resolução

Enviar uma imagem de referência comprimida ou pequena é a forma mais rápida de obter resultados inconsistentes. Quando o modelo não consegue resolver detalhes finos na referência, ele preenche as lacunas com as próprias noções prévias. O resultado é um vídeo que captura o clima geral da referência, mas não os seus detalhes. Seu sujeito parece diferente. A luz está no lugar errado.

Recomendação mínima: 1024x576px para conteúdo 16:9. Busque 1920x1080px quando o detalhe do sujeito for importante.

Prompts conflitantes

Um prompt que descreve a aparência do sujeito muitas vezes vai sobrepor ou diluir a influência da imagem de referência. Isso acontece porque o Veo 3.1 recebe os dois como instruções e precisa ponderar entre eles. Quanto mais específica e detalhada for a descrição da aparência, mais ela afasta o modelo da referência.

A correção é simples: remova toda linguagem de aparência do seu prompt e substitua-a apenas por linguagem de movimento.

Ignorar a proporção

A imagem de referência e o vídeo de saída devem ter a mesma proporção. Enviar um retrato quadrado 1:1 como referência e pedir uma saída 16:9 obriga o modelo a inventar o que existe fora do quadro. Às vezes isso funciona. Com frequência, produz proporções distorcidas ou uma extrapolação incorreta do ambiente.

Recorte sua referência na proporção de saída pretendida antes de enviá-la.

Mãos segurando um tablet exibindo a interface de geração de vídeo com IA e uma grade de imagens de referência

O que você pode criar agora

A geração de vídeo guiada por referência com o Veo 3.1 não é teórica. Estes são tipos de conteúdo específicos que produzem bons resultados nesse fluxo de trabalho hoje.

Conteúdo de moda e estilo de vida

É aqui que a tecnologia é mais útil de imediato. Marcas de moda e criadores de estilo de vida precisam de vídeos de produtos específicos em pessoas específicas e em cenários específicos. A geração guiada por referência permite partir de fotografias já existentes, gravar menos horas e produzir mais conteúdo.

Uma única fotografia de moda de alta qualidade vira um clipe de 5 segundos, um estudo de textura em close e um vídeo de estilo de vida ao ar livre, tudo com consistência visual em cada resultado.

Vídeos de viagem e destinos

Produtores de conteúdo de viagem costumam ter fotografias de locais, mas precisam de vídeo. A geração guiada por referência preenche essa lacuna. Uma fotografia de paisagem vira uma panorâmica lenta e cinematográfica. Um interior arquitetônico vira um avanço suave pelo espaço. A referência ancora o modelo nos detalhes visuais do local real, em vez de uma interpretação genérica da cena.

Clipes de vitrine de produtos

Marcas de e-commerce precisam de vídeo de produto, mas nem sempre têm orçamento para uma produção completa. Uma foto de destaque do produto como imagem de referência, combinada com um prompt de movimento de rotação ou revelação, produz um vídeo de produto utilizável que combina com a fotografia já existente da marca. A cor, a iluminação e o tratamento do fundo da referência passam diretamente para o vídeo.

Estúdio de vídeo profissional com vários monitores exibindo resultados gerados por IA

Comece a criar com suas próprias referências

A forma mais rápida de ver o que o Ingredients to Video do Veo 3.1 faz é testá-lo você mesmo. Escolha uma fotografia que você já tenha, com iluminação clara e um sujeito nítido. Escreva um prompt curto, em uma frase, descrevendo o que deve acontecer na cena. Envie os dois para o Veo 3.1 no PicassoIA e execute sua primeira geração.

O primeiro resultado vai mostrar mais sobre como as imagens de referência interagem com este modelo do que qualquer explicação escrita. A partir daí, ajuste a seleção de referências, refine o prompt, experimente o Veo 3.1 Fast para ciclos de iteração mais rápidos e compare resultados com o Kling V3 ou o Wan 2.6 i2v para descobrir o que atende às suas necessidades específicas de conteúdo.

O PicassoIA dá acesso a todos esses modelos em um só lugar, então você pode rodar a mesma referência em vários sistemas e comparar os resultados lado a lado. Essa comparação direta é o circuito de feedback mais preciso para desenvolver intuição sobre geração de vídeo com IA usando imagens de referência.

Painel de storyboard com fotografias de referência planejando o fluxo de trabalho de vídeo com IA

Compartilhe este artigo

Escolha seu idioma