API do OmniHuman 1.5: preços, sincronização labial e vídeos de avatar
O OmniHuman 1.5 transforma uma foto de retrato e um arquivo de áudio em um vídeo falado, cobrado a US$ 0,16 por segundo na fal.ai. Este artigo detalha o custo real de cada clipe, os limites de entrada, a qualidade da sincronização labial e como usar o modelo na PicassoIA sem escrever código.
Uma única foto de retrato e uma gravação de voz de 30 segundos podem virar um vídeo falado por US$ 4,80. Essa é a conta por trás da API do OmniHuman 1.5, modelo de avatar guiado por áudio da ByteDance, que a fal.ai cobra a US$ 0,16 por segundo de vídeo gerado. Sem câmera, sem estúdio, sem ator. Só um rosto, uma voz e alguns minutos de espera.
Este artigo coloca números reais nisso. Você vai ver quanto custam clipes de diferentes durações, quais limites realmente vão bloquear você (duração do áudio, resolução, formatos de arquivo), como a sincronização labial se sai em rostos reais e em que situações uma foto falante supera a gravação com câmera. Também há um passo a passo para rodar o OmniHuman 1.5 na PicassoIA direto do navegador, além de uma lista curta de alternativas para testar em comparação.
💡 Resposta rápida: o OmniHuman 1.5 recebe uma imagem de uma pessoa mais um arquivo de áudio e devolve um vídeo em que o rosto e a cabeça se movem com a fala. Na fal.ai custa US$ 0,16 por segundo e aceita até 60 segundos de áudio em 720p ou 30 segundos em 1080p.
O que o OmniHuman 1.5 realmente faz
O OmniHuman 1.5 é um modelo de imagem para vídeo construído em torno do áudio. Em vez de inventar uma cena a partir de um prompt de texto, ele parte de uma pessoa que você já tem e faz essa pessoa falar, cantar ou reagir ao som que você fornecer.
Uma foto, um arquivo de áudio
O fluxo de trabalho é quase simples demais. Envie uma imagem que contenha uma pessoa, um rosto ou um personagem. Envie uma faixa de áudio. O modelo anima o sujeito para que a boca, as expressões e o movimento da cabeça acompanhem o som. Um prompt de texto opcional permite direcionar gestos, composição da cena ou movimento de câmera.
Três coisas o diferenciam das ferramentas mais antigas de foto falante:
Movimento além dos lábios. Expressões faciais, gestos e movimento da cabeça respondem à emoção e ao ritmo da fala, não apenas às palavras.
Sujeitos flexíveis. O OmniHuman 1.5 na PicassoIA aceita retratos reais, fotos de corpo inteiro e personagens ilustrados.
Áudio multilíngue. A página da PicassoIA lista narrações em inglês, espanhol, japonês, coreano, chinês e indonésio.
O que mudou em relação ao OmniHuman 1
O modelo original continua disponível, e a diferença entre os dois é pequena o bastante para que o preço entre na decisão. A própria comparação da fal.ai os coloca lado a lado:
Recurso
OmniHuman (original)
OmniHuman 1.5
Preço na fal.ai
US$ 0,14 por segundo
US$ 0,16 por segundo
Resolução
Fixa, sem escolha
720p ou 1080p
Limite de áudio
30 segundos
60 segundos em 720p, 30 segundos em 1080p
Modo turbo
Não disponível
Disponível
Entradas difíceis
Às vezes precisa de várias tentativas
Mais confiável na primeira tentativa
"Entradas difíceis" significa rostos parcialmente escondidos, áudio com ruído, iluminação dura e retratos em ângulo, os casos que antes estragavam uma tomada.
Na PicassoIA a diferença também é visível. A página original do OmniHuman recomenda áudios de 15 segundos ou menos, porque a qualidade começa a cair depois disso. O OmniHuman 1.5 aceita clipes com menos de 35 segundos e acrescenta um prompt de texto, um modo rápido e um seed.
Preço da API do OmniHuman 1.5 explicado
O preço é a parte mais simples deste modelo. Você paga por segundo de vídeo gerado, e a saída dura o mesmo tempo que o seu áudio. Uma narração de 12 segundos gera um vídeo de 12 segundos e uma conta de US$ 1,92.
Custo por segundo de vídeo
Veja quanto custam as durações mais comuns de clipe, na tarifa da fal.ai de US$ 0,16 por segundo:
Duração do clipe
Custo
Uso típico
5 segundos
US$ 0,80
Trecho de teste antes de uma geração completa
15 segundos
US$ 2,40
Publicação em redes sociais ou saudação curta
30 segundos
US$ 4,80
Apresentação de produto, clipe mais longo em 1080p
60 segundos
US$ 9,60
Vídeo explicativo, clipe mais longo em 720p
A escala muda o quadro rapidamente. Cem clipes de 30 segundos custam US$ 480. Uma atualização semanal de 20 segundos durante um ano inteiro (52 clipes) custa US$ 166,40. Para deixar concreto, aqui estão três orçamentos mensais realistas:
Cenário
Saída
Segundos
Custo mensal
Criador solo
8 clipes de 20 segundos
160
US$ 25,60
Pequena loja online
30 clipes de 15 segundos
450
US$ 72,00
Equipe de treinamento
40 aulas de 45 segundos
1.800
US$ 288,00
A versão 1.5 custa mais que o original, que a fal.ai lista a US$ 0,14 por segundo. Em um clipe de 30 segundos isso representa US$ 4,20 contra US$ 4,80, ou seja, 60 centavos a mais, ou 14 por cento. Em 100 clipes assim, a diferença chega a US$ 60. Se o limite maior de áudio e a escolha de resolução compensam isso depende inteiramente do seu volume.
💡 Confira seu provedor. Os números acima vêm da fal.ai. Outros provedores de API definem suas próprias tarifas, então leia a linha de preço do seu provedor antes de orçar uma campanha.
Formas de reduzir a conta
Você paga por cada segundo, então a economia vem de desperdiçar menos deles:
Teste primeiro com 5 segundos. Um trecho de US$ 0,80 mostra se o retrato funciona antes de você gastar US$ 9,60 em um minuto completo.
Corte o silêncio. Pausas mortas no início e no fim de um arquivo de áudio viram vídeo cobrado.
Rascunhe rápido, finalize com calma. Use 720p ou modo turbo nos rascunhos e renderize a tomada aprovada em 1080p. Verifique se o seu provedor cobra o turbo de forma diferente.
Corte para imagens de apoio. Deixe o avatar falar por 10 segundos e depois mostre o produto por 5. Você paga apenas pelos segundos de fala.
Guarde o seed. Quando uma tomada funcionar, reutilize o seed dela na PicassoIA para reproduzi-la, em vez de pagar duas vezes por um palpite de sorte.
Entradas, limites e parâmetros
A maioria das gerações falhadas vem dos mesmos poucos erros de entrada. Estes são os limites que importam.
Requisitos de imagem e áudio
Os dois lugares onde você pode rodar o modelo têm regras levemente diferentes:
Entrada
API da fal.ai
PicassoIA
Imagem
image_url, JPEG ou PNG, acessível publicamente
Envie uma foto com uma pessoa, rosto ou personagem
Áudio
audio_url, MP3, WAV ou M4A
MP3, WAV e formatos semelhantes
Duração do áudio
60 s em 720p, 30 s em 1080p
Menos de 35 segundos, arquivos mais longos falham
Resolução
720p ou 1080p, padrão 1080p
Não aparece como configuração
Entradas opcionais
prompt, turbo_mode, mask_url
Prompt, modo rápido, seed
Se você chamar o modelo pela fal.ai, o endpoint é fal-ai/bytedance/omnihuman/v1.5. Instale @fal-ai/client, defina seu token de API da fal.ai como variável de ambiente, e uma chamada fica assim:
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("fal-ai/bytedance/omnihuman/v1.5", {
input: {
image_url: "https://example.com/portrait.jpg",
audio_url: "https://example.com/voiceover.mp3",
resolution: "720p",
turbo_mode: false,
prompt: "Warm smile, small hand gestures, steady medium shot"
},
logs: true
});
console.log(result.data.video.url);
A URL do vídeo volta em data.video.url. A fal.ai observa que o link fica válido por cerca de 24 horas, então baixe o arquivo e guarde-o em um lugar permanente logo em seguida.
Resolução, modo turbo e prompts
Resolução. O 1080p é o padrão e limita o áudio a 30 segundos. Mude para 720p quando precisar de até 60 segundos ou de geração mais rápida.
Modo turbo. Saída mais rápida em troca de alguma qualidade. Ótimo para testar um retrato, não para a entrega final. A PicassoIA chama a mesma ideia de modo rápido.
Prompt. Texto opcional para expressões, movimento e câmera. A PicassoIA aceita prompts em chinês, inglês, japonês, coreano, espanhol e indonésio.
Máscara. Na fal.ai, mask_url isola a pessoa que deve falar quando várias pessoas aparecem no quadro.
Escreva prompts sobre comportamento, não sobre lábios. "Sorriso calmo, leve aceno, mãos apoiadas na mesa" funciona melhor do que "a boca se move com as palavras", porque o áudio já cuida da boca.
Qualidade da sincronização labial na prática
A sincronização labial é onde os modelos de avatar ganham ou perdem, então avalie do jeito que o público vai avaliar: no celular, em velocidade normal, com o som ligado.
Onde ele se destaca
Correspondência emocional. Sorrisos, movimento das sobrancelhas e inclinações da cabeça seguem o tom da voz, então uma leitura animada parece animada.
Entradas imperfeitas. A fal.ai relata melhor tratamento de rostos parcialmente escondidos, áudio com ruído, iluminação difícil e retratos em ângulo do que o modelo original.
Clipes com um único falante. Um monólogo de 10 a 30 segundos é o ponto ideal: uma apresentação de produto, um anúncio, a introdução de uma aula.
Personagens ilustrados. Mascotes e retratos estilizados também ganham vida, o que ajuda marcas sem um porta-voz.
Onde ainda tem dificuldades
Limites de duração. Menos de 35 segundos na PicassoIA e, no máximo, 60 segundos na fal.ai. Roteiros mais longos precisam ser divididos em cenas e editados juntos.
Tempo de espera. Os três exemplos publicados pela PicassoIA com o modo rápido ativado levaram 197, 280 e 370 segundos, cerca de 3 a 6 minutos cada. Isso descarta chat ao vivo ou uso em tempo real.
Refações. Mesmo com mais confiabilidade, reserve para uma segunda tentativa de vez em quando em retratos difíceis.
Entradas fracas. Um rosto pequeno, borrado ou com filtros pesados gera um resultado fraco. Uma narração plana e monótona gera uma atuação plana.
Usos reais para vídeos de avatar
Os casos de uso mais fortes têm uma característica em comum: uma pessoa precisa aparecer na tela, mas filmar essa pessoa é lento, caro ou impossível.
Explicações de produtos e anúncios
Um pequeno lojista pode transformar uma única foto do fundador em uma apresentação de produto de 20 segundos para cada novo item, gravada uma vez em áudio e atualizada sempre que o roteiro mudar.
O formato funciona bem em páginas de destino, anúncios pagos em redes sociais e anúncios em marketplaces, onde um rosto humano curto aumenta a confiança. Combine o clipe falado com imagens de apoio do produto, e o avatar só precisa falar na abertura e na oferta final.
Treinamento e educação
Criadores de cursos podem produzir um apresentador para cada aula sem gravar na frente da câmera. Escreva a introdução da aula, grave o áudio e deixe o retrato apresentá-la. Mantenha cada clipe abaixo do limite de duração e encadeie vários clipes curtos ao longo da aula.
Equipes internas usam o mesmo truque para mensagens de integração e atualizações de políticas, onde um rosto consistente importa mais do que um acabamento cinematográfico.
Mensagens multilíngues
Um único retrato pode levar muitas vozes. Grave ou gere o mesmo roteiro em espanhol, japonês e inglês, depois rode cada arquivo com a mesma foto. Os lábios acompanham o idioma em vez de lutar contra ele.
Se você já tem imagens filmadas e só precisa de dublagem, o Video Translate cuida desse trabalho, enquanto o OmniHuman 1.5 é a melhor escolha quando tudo o que você tem é uma foto parada.
💡 Use rostos reais com responsabilidade. Anime a foto de uma pessoa real somente quando tiver a permissão dela, nunca imite alguém para enganar o público e identifique vídeos sintéticos sempre que uma plataforma pedir.
Como usar o OmniHuman 1.5 na PicassoIA
Você não precisa de conta de API nem de código. O OmniHuman 1.5 na PicassoIA roda no navegador: dois envios, um prompt opcional, um clique.
Prepare o retrato
Escolha uma foto em que o rosto esteja claramente visível, com iluminação uniforme e voltado para a câmera ou levemente virado. Evite óculos escuros, filtros pesados e rostos pequenos em meio a uma multidão.
Não tem uma foto adequada? Gere uma com o Seedream 4.5, que produz imagens em 2K ou 4K em 16:9 e em outras proporções. Descreva uma pessoa realista, expressão neutra e luz suave de janela, depois use o resultado como seu avatar.
Adicione seu áudio
Grave a sua própria voz ou gere uma narração com o Speech 2.8 HD ou o ElevenLabs v3. Exporte em MP3 ou WAV e mantenha menos de 35 segundos, já que arquivos mais longos fazem a geração falhar. Remova a música de fundo, porque uma fala limpa dá a sincronia mais precisa.
Rode e verifique o resultado
Envie a imagem e o áudio, adicione um prompt se quiser direção, e inicie a geração. Os exemplos publicados do modo rápido da PicassoIA terminaram em cerca de 3 a 6 minutos. Depois, revise o clipe nesta ordem:
Os primeiros dois segundos, onde os erros de sincronia aparecem primeiro.
Dentes e cantos da boca em vogais longas.
Mãos e ombros, para ver se o movimento parece natural.
Veja como cada parâmetro se comporta:
Parâmetro
O que faz
Dica
Imagem
A pessoa que fala
De frente, nítida, bem iluminada
Áudio
Conduz a fala e a duração
Menos de 35 segundos, sem música
Prompt
Cena, movimento e câmera
Descreva comportamento, não lábios
Modo rápido
Troca detalhe fino por velocidade
Ligado para rascunhos, desligado para finais
Seed
Torna uma tomada reproduzível
Guarde o seed de qualquer tomada aprovada
Três prompts que valem a pena copiar como ponto de partida:
"Apresentador simpático, ombros relaxados, leves acenos, plano médio estável."
"Entrega enérgica, sorriso largo, gestos expressivos com as mãos, luz suave do dia."
"Tom calmo e sério, movimento mínimo, aproximação lenta no rosto."
Outros modelos de avatar que valem a pena testar
Nenhum modelo vence em todos os trabalhos, e cada um desses está disponível na mesma plataforma, então um teste lado a lado custa apenas alguns minutos.
Escolha pela entrada. Se você parte de uma foto e de uma gravação, comece com o OmniHuman 1.5 e compare com o Fabric 1.0 ou o Kling Avatar v2. Se você só tem um roteiro escrito e nenhuma voz, o P Video Avatar pode falá-lo para você. Se você já gravou o vídeo e só precisa de novos lábios, o Lipsync 2 Pro reescreve o movimento da boca para combinar com uma nova faixa de áudio.
Faça sua primeira foto falante hoje
Ler sobre preços só leva você até certo ponto. A forma mais rápida de avaliar o OmniHuman 1.5 é alimentá-lo com seu próprio retrato e um recado de voz de 10 segundos, depois assistir ao resultado em velocidade normal.
Gere um rosto com o Seedream 4.5, grave ou sintetize uma fala curta, e rode os dois pelo OmniHuman 1.5. Teste a mesma foto com três vozes diferentes. Troque o prompt de "calmo e firme" para "enérgico, sorriso largo" e compare as tomadas.
Todos os modelos citados aqui estão em um só lugar, em picassoia.com/en/all-models. Abra a página, escolha dois modelos de avatar e faça seu primeiro vídeo falado antes que o café esfrie.