API do OmniHuman 1.5: preços, sincronização labial e vídeos de avatar

O OmniHuman 1.5 transforma uma foto de retrato e um arquivo de áudio em um vídeo falado, cobrado a US$ 0,16 por segundo na fal.ai. Este artigo detalha o custo real de cada clipe, os limites de entrada, a qualidade da sincronização labial e como usar o modelo na PicassoIA sem escrever código.

API do OmniHuman 1.5: preços, sincronização labial e vídeos de avatar
Cristian Da Conceicao
Fundador do Picasso IA

Uma única foto de retrato e uma gravação de voz de 30 segundos podem virar um vídeo falado por US$ 4,80. Essa é a conta por trás da API do OmniHuman 1.5, modelo de avatar guiado por áudio da ByteDance, que a fal.ai cobra a US$ 0,16 por segundo de vídeo gerado. Sem câmera, sem estúdio, sem ator. Só um rosto, uma voz e alguns minutos de espera.

Este artigo coloca números reais nisso. Você vai ver quanto custam clipes de diferentes durações, quais limites realmente vão bloquear você (duração do áudio, resolução, formatos de arquivo), como a sincronização labial se sai em rostos reais e em que situações uma foto falante supera a gravação com câmera. Também há um passo a passo para rodar o OmniHuman 1.5 na PicassoIA direto do navegador, além de uma lista curta de alternativas para testar em comparação.

💡 Resposta rápida: o OmniHuman 1.5 recebe uma imagem de uma pessoa mais um arquivo de áudio e devolve um vídeo em que o rosto e a cabeça se movem com a fala. Na fal.ai custa US$ 0,16 por segundo e aceita até 60 segundos de áudio em 720p ou 30 segundos em 1080p.

O que o OmniHuman 1.5 realmente faz

O OmniHuman 1.5 é um modelo de imagem para vídeo construído em torno do áudio. Em vez de inventar uma cena a partir de um prompt de texto, ele parte de uma pessoa que você já tem e faz essa pessoa falar, cantar ou reagir ao som que você fornecer.

Uma foto, um arquivo de áudio

O fluxo de trabalho é quase simples demais. Envie uma imagem que contenha uma pessoa, um rosto ou um personagem. Envie uma faixa de áudio. O modelo anima o sujeito para que a boca, as expressões e o movimento da cabeça acompanhem o som. Um prompt de texto opcional permite direcionar gestos, composição da cena ou movimento de câmera.

Close de uma mulher sorridente falando para a câmera em uma cozinha iluminada

Três coisas o diferenciam das ferramentas mais antigas de foto falante:

  • Movimento além dos lábios. Expressões faciais, gestos e movimento da cabeça respondem à emoção e ao ritmo da fala, não apenas às palavras.
  • Sujeitos flexíveis. O OmniHuman 1.5 na PicassoIA aceita retratos reais, fotos de corpo inteiro e personagens ilustrados.
  • Áudio multilíngue. A página da PicassoIA lista narrações em inglês, espanhol, japonês, coreano, chinês e indonésio.

O que mudou em relação ao OmniHuman 1

O modelo original continua disponível, e a diferença entre os dois é pequena o bastante para que o preço entre na decisão. A própria comparação da fal.ai os coloca lado a lado:

RecursoOmniHuman (original)OmniHuman 1.5
Preço na fal.aiUS$ 0,14 por segundoUS$ 0,16 por segundo
ResoluçãoFixa, sem escolha720p ou 1080p
Limite de áudio30 segundos60 segundos em 720p, 30 segundos em 1080p
Modo turboNão disponívelDisponível
Entradas difíceisÀs vezes precisa de várias tentativasMais confiável na primeira tentativa

"Entradas difíceis" significa rostos parcialmente escondidos, áudio com ruído, iluminação dura e retratos em ângulo, os casos que antes estragavam uma tomada.

Na PicassoIA a diferença também é visível. A página original do OmniHuman recomenda áudios de 15 segundos ou menos, porque a qualidade começa a cair depois disso. O OmniHuman 1.5 aceita clipes com menos de 35 segundos e acrescenta um prompt de texto, um modo rápido e um seed.

Preço da API do OmniHuman 1.5 explicado

O preço é a parte mais simples deste modelo. Você paga por segundo de vídeo gerado, e a saída dura o mesmo tempo que o seu áudio. Uma narração de 12 segundos gera um vídeo de 12 segundos e uma conta de US$ 1,92.

Vista de cima de uma mesa com um caderno de anotações com números a lápis, uma calculadora e um cronômetro

Custo por segundo de vídeo

Veja quanto custam as durações mais comuns de clipe, na tarifa da fal.ai de US$ 0,16 por segundo:

Duração do clipeCustoUso típico
5 segundosUS$ 0,80Trecho de teste antes de uma geração completa
15 segundosUS$ 2,40Publicação em redes sociais ou saudação curta
30 segundosUS$ 4,80Apresentação de produto, clipe mais longo em 1080p
60 segundosUS$ 9,60Vídeo explicativo, clipe mais longo em 720p

A escala muda o quadro rapidamente. Cem clipes de 30 segundos custam US$ 480. Uma atualização semanal de 20 segundos durante um ano inteiro (52 clipes) custa US$ 166,40. Para deixar concreto, aqui estão três orçamentos mensais realistas:

CenárioSaídaSegundosCusto mensal
Criador solo8 clipes de 20 segundos160US$ 25,60
Pequena loja online30 clipes de 15 segundos450US$ 72,00
Equipe de treinamento40 aulas de 45 segundos1.800US$ 288,00

A versão 1.5 custa mais que o original, que a fal.ai lista a US$ 0,14 por segundo. Em um clipe de 30 segundos isso representa US$ 4,20 contra US$ 4,80, ou seja, 60 centavos a mais, ou 14 por cento. Em 100 clipes assim, a diferença chega a US$ 60. Se o limite maior de áudio e a escolha de resolução compensam isso depende inteiramente do seu volume.

💡 Confira seu provedor. Os números acima vêm da fal.ai. Outros provedores de API definem suas próprias tarifas, então leia a linha de preço do seu provedor antes de orçar uma campanha.

Formas de reduzir a conta

Você paga por cada segundo, então a economia vem de desperdiçar menos deles:

  1. Teste primeiro com 5 segundos. Um trecho de US$ 0,80 mostra se o retrato funciona antes de você gastar US$ 9,60 em um minuto completo.
  2. Corte o silêncio. Pausas mortas no início e no fim de um arquivo de áudio viram vídeo cobrado.
  3. Rascunhe rápido, finalize com calma. Use 720p ou modo turbo nos rascunhos e renderize a tomada aprovada em 1080p. Verifique se o seu provedor cobra o turbo de forma diferente.
  4. Corte para imagens de apoio. Deixe o avatar falar por 10 segundos e depois mostre o produto por 5. Você paga apenas pelos segundos de fala.
  5. Guarde o seed. Quando uma tomada funcionar, reutilize o seed dela na PicassoIA para reproduzi-la, em vez de pagar duas vezes por um palpite de sorte.

Entradas, limites e parâmetros

A maioria das gerações falhadas vem dos mesmos poucos erros de entrada. Estes são os limites que importam.

Requisitos de imagem e áudio

Os dois lugares onde você pode rodar o modelo têm regras levemente diferentes:

EntradaAPI da fal.aiPicassoIA
Imagemimage_url, JPEG ou PNG, acessível publicamenteEnvie uma foto com uma pessoa, rosto ou personagem
Áudioaudio_url, MP3, WAV ou M4AMP3, WAV e formatos semelhantes
Duração do áudio60 s em 720p, 30 s em 1080pMenos de 35 segundos, arquivos mais longos falham
Resolução720p ou 1080p, padrão 1080pNão aparece como configuração
Entradas opcionaisprompt, turbo_mode, mask_urlPrompt, modo rápido, seed

Vista por cima do ombro de um desenvolvedor digitando código em um notebook em um escritório loft

Se você chamar o modelo pela fal.ai, o endpoint é fal-ai/bytedance/omnihuman/v1.5. Instale @fal-ai/client, defina seu token de API da fal.ai como variável de ambiente, e uma chamada fica assim:

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("fal-ai/bytedance/omnihuman/v1.5", {
  input: {
    image_url: "https://example.com/portrait.jpg",
    audio_url: "https://example.com/voiceover.mp3",
    resolution: "720p",
    turbo_mode: false,
    prompt: "Warm smile, small hand gestures, steady medium shot"
  },
  logs: true
});

console.log(result.data.video.url);

A URL do vídeo volta em data.video.url. A fal.ai observa que o link fica válido por cerca de 24 horas, então baixe o arquivo e guarde-o em um lugar permanente logo em seguida.

Resolução, modo turbo e prompts

  • Resolução. O 1080p é o padrão e limita o áudio a 30 segundos. Mude para 720p quando precisar de até 60 segundos ou de geração mais rápida.
  • Modo turbo. Saída mais rápida em troca de alguma qualidade. Ótimo para testar um retrato, não para a entrega final. A PicassoIA chama a mesma ideia de modo rápido.
  • Prompt. Texto opcional para expressões, movimento e câmera. A PicassoIA aceita prompts em chinês, inglês, japonês, coreano, espanhol e indonésio.
  • Máscara. Na fal.ai, mask_url isola a pessoa que deve falar quando várias pessoas aparecem no quadro.

Escreva prompts sobre comportamento, não sobre lábios. "Sorriso calmo, leve aceno, mãos apoiadas na mesa" funciona melhor do que "a boca se move com as palavras", porque o áudio já cuida da boca.

Qualidade da sincronização labial na prática

A sincronização labial é onde os modelos de avatar ganham ou perdem, então avalie do jeito que o público vai avaliar: no celular, em velocidade normal, com o som ligado.

Perfil lateral de um dublador falando em um microfone de estúdio com filtro pop

Onde ele se destaca

  • Correspondência emocional. Sorrisos, movimento das sobrancelhas e inclinações da cabeça seguem o tom da voz, então uma leitura animada parece animada.
  • Entradas imperfeitas. A fal.ai relata melhor tratamento de rostos parcialmente escondidos, áudio com ruído, iluminação difícil e retratos em ângulo do que o modelo original.
  • Clipes com um único falante. Um monólogo de 10 a 30 segundos é o ponto ideal: uma apresentação de produto, um anúncio, a introdução de uma aula.
  • Personagens ilustrados. Mascotes e retratos estilizados também ganham vida, o que ajuda marcas sem um porta-voz.

Onde ainda tem dificuldades

  • Limites de duração. Menos de 35 segundos na PicassoIA e, no máximo, 60 segundos na fal.ai. Roteiros mais longos precisam ser divididos em cenas e editados juntos.
  • Tempo de espera. Os três exemplos publicados pela PicassoIA com o modo rápido ativado levaram 197, 280 e 370 segundos, cerca de 3 a 6 minutos cada. Isso descarta chat ao vivo ou uso em tempo real.
  • Refações. Mesmo com mais confiabilidade, reserve para uma segunda tentativa de vez em quando em retratos difíceis.
  • Entradas fracas. Um rosto pequeno, borrado ou com filtros pesados gera um resultado fraco. Uma narração plana e monótona gera uma atuação plana.

Usos reais para vídeos de avatar

Os casos de uso mais fortes têm uma característica em comum: uma pessoa precisa aparecer na tela, mas filmar essa pessoa é lento, caro ou impossível.

Explicações de produtos e anúncios

Um pequeno lojista pode transformar uma única foto do fundador em uma apresentação de produto de 20 segundos para cada novo item, gravada uma vez em áudio e atualizada sempre que o roteiro mudar.

Mulher com avental jeans fotografando uma caneca de grés em uma oficina de cerâmica

O formato funciona bem em páginas de destino, anúncios pagos em redes sociais e anúncios em marketplaces, onde um rosto humano curto aumenta a confiança. Combine o clipe falado com imagens de apoio do produto, e o avatar só precisa falar na abertura e na oferta final.

Treinamento e educação

Criadores de cursos podem produzir um apresentador para cada aula sem gravar na frente da câmera. Escreva a introdução da aula, grave o áudio e deixe o retrato apresentá-la. Mantenha cada clipe abaixo do limite de duração e encadeie vários clipes curtos ao longo da aula.

Professora de cardigã gravando uma aula em uma mesa de sala de aula

Equipes internas usam o mesmo truque para mensagens de integração e atualizações de políticas, onde um rosto consistente importa mais do que um acabamento cinematográfico.

Mensagens multilíngues

Um único retrato pode levar muitas vozes. Grave ou gere o mesmo roteiro em espanhol, japonês e inglês, depois rode cada arquivo com a mesma foto. Os lábios acompanham o idioma em vez de lutar contra ele.

Jovem com fones de ouvido segurando um tablet em frente a um mapa-múndi

Se você já tem imagens filmadas e só precisa de dublagem, o Video Translate cuida desse trabalho, enquanto o OmniHuman 1.5 é a melhor escolha quando tudo o que você tem é uma foto parada.

💡 Use rostos reais com responsabilidade. Anime a foto de uma pessoa real somente quando tiver a permissão dela, nunca imite alguém para enganar o público e identifique vídeos sintéticos sempre que uma plataforma pedir.

Como usar o OmniHuman 1.5 na PicassoIA

Você não precisa de conta de API nem de código. O OmniHuman 1.5 na PicassoIA roda no navegador: dois envios, um prompt opcional, um clique.

Mãos de uma mulher em um notebook com uma janela de envio mostrando a miniatura de um retrato e um arquivo de áudio

Prepare o retrato

Escolha uma foto em que o rosto esteja claramente visível, com iluminação uniforme e voltado para a câmera ou levemente virado. Evite óculos escuros, filtros pesados e rostos pequenos em meio a uma multidão.

Não tem uma foto adequada? Gere uma com o Seedream 4.5, que produz imagens em 2K ou 4K em 16:9 e em outras proporções. Descreva uma pessoa realista, expressão neutra e luz suave de janela, depois use o resultado como seu avatar.

Adicione seu áudio

Grave a sua própria voz ou gere uma narração com o Speech 2.8 HD ou o ElevenLabs v3. Exporte em MP3 ou WAV e mantenha menos de 35 segundos, já que arquivos mais longos fazem a geração falhar. Remova a música de fundo, porque uma fala limpa dá a sincronia mais precisa.

Rode e verifique o resultado

Envie a imagem e o áudio, adicione um prompt se quiser direção, e inicie a geração. Os exemplos publicados do modo rápido da PicassoIA terminaram em cerca de 3 a 6 minutos. Depois, revise o clipe nesta ordem:

  1. Os primeiros dois segundos, onde os erros de sincronia aparecem primeiro.
  2. Dentes e cantos da boca em vogais longas.
  3. Mãos e ombros, para ver se o movimento parece natural.

Veja como cada parâmetro se comporta:

ParâmetroO que fazDica
ImagemA pessoa que falaDe frente, nítida, bem iluminada
ÁudioConduz a fala e a duraçãoMenos de 35 segundos, sem música
PromptCena, movimento e câmeraDescreva comportamento, não lábios
Modo rápidoTroca detalhe fino por velocidadeLigado para rascunhos, desligado para finais
SeedTorna uma tomada reproduzívelGuarde o seed de qualquer tomada aprovada

Três prompts que valem a pena copiar como ponto de partida:

  • "Apresentador simpático, ombros relaxados, leves acenos, plano médio estável."
  • "Entrega enérgica, sorriso largo, gestos expressivos com as mãos, luz suave do dia."
  • "Tom calmo e sério, movimento mínimo, aproximação lenta no rosto."

Outros modelos de avatar que valem a pena testar

Nenhum modelo vence em todos os trabalhos, e cada um desses está disponível na mesma plataforma, então um teste lado a lado custa apenas alguns minutos.

Quatro colegas sentados em volta de uma mesa comparando clipes de vídeo de retratos em uma tela na parede

ModeloMelhor paraObservações
OmniHuman 1.5Clipes expressivos de até 35 segundosPrompt, modo rápido e seed
OmniHumanClipes curtosMelhor qualidade em 15 segundos ou menos
Fabric 1.0Fotos falantes rápidasSaída em 480p ou 720p
Kling Avatar v2Rostos, desenhos e animaisModos Standard e Pro, prompt opcional
P Video AvatarDo roteiro ao vídeo sem áudioMais de 30 vozes, 10 idiomas, até 1080p
Lipsync 2 ProResincronizar filmagens existentesRecebe um vídeo MP4 e um arquivo de áudio WAV

Escolha pela entrada. Se você parte de uma foto e de uma gravação, comece com o OmniHuman 1.5 e compare com o Fabric 1.0 ou o Kling Avatar v2. Se você só tem um roteiro escrito e nenhuma voz, o P Video Avatar pode falá-lo para você. Se você já gravou o vídeo e só precisa de novos lábios, o Lipsync 2 Pro reescreve o movimento da boca para combinar com uma nova faixa de áudio.

Faça sua primeira foto falante hoje

Ler sobre preços só leva você até certo ponto. A forma mais rápida de avaliar o OmniHuman 1.5 é alimentá-lo com seu próprio retrato e um recado de voz de 10 segundos, depois assistir ao resultado em velocidade normal.

Gere um rosto com o Seedream 4.5, grave ou sintetize uma fala curta, e rode os dois pelo OmniHuman 1.5. Teste a mesma foto com três vozes diferentes. Troque o prompt de "calmo e firme" para "enérgico, sorriso largo" e compare as tomadas.

Todos os modelos citados aqui estão em um só lugar, em picassoia.com/en/all-models. Abra a página, escolha dois modelos de avatar e faça seu primeiro vídeo falado antes que o café esfrie.

Compartilhe este artigo

Escolha seu idioma