API do Kling Avatar 2.0: preços de lip sync e exemplos

O Kling Avatar 2.0 transforma uma foto e um arquivo de áudio em um vídeo falado. Este artigo lista os preços por segundo da API na fal, na PoYo e na Picsart, mostra uma requisição funcional, faz as contas de custo com durações reais de clipes e compara modelos de foto falante que você pode usar no PicassoIA.

API do Kling Avatar 2.0: preços de lip sync e exemplos
Cristian Da Conceicao
Fundador do Picasso IA

O Kling Avatar 2.0 recebe uma foto de retrato e um arquivo de áudio e devolve um vídeo falado, em que os lábios, os olhos e o movimento da cabeça acompanham a fala. O modelo é cobrado por segundo de áudio, o que torna os preços de lip sync da API do Kling Avatar 2.0 fáceis de prever, desde que você saiba qual provedor vai chamar e qual nível escolher. Este artigo coloca os números reais lado a lado: US$ 0,056 por segundo na fal, US$ 0,035 na PoYo e 2 créditos na Picsart, com as tarifas Pro cerca de duas vezes maiores em cada uma delas. Você também recebe uma requisição funcional, três exemplos no estilo de produção, regras de entrada que evitam renderizações ruins e um tutorial com os modelos de lip sync mais parecidos disponíveis no PicassoIA.

O que o Kling Avatar 2.0 faz

O Kling Avatar 2.0 é um modelo de avatar guiado por áudio da família Kling. Você entrega uma imagem estática e uma gravação de fala, e ele anima o rosto para que o formato da boca acompanhe as sílabas, os olhos mantenham contato com a lente e a cabeça e os ombros se movam como os de um falante real. Não há filmagem nem esqueleto 3D envolvidos, e a identidade da pessoa na foto permanece estável do primeiro ao último quadro.

Um fotógrafo iluminando um retrato de estúdio de uma mulher sorridente de blazer azul-marinho

Uma foto, um arquivo de áudio

O contrato de entrada é curto. Todos os provedores que verifiquei pedem as mesmas três coisas:

  • Uma imagem de uma pessoa, animal, desenho animado ou personagem estilizado. A PoYo aceita arquivos JPEG, PNG e WebP de até 10 MB.
  • Um arquivo de áudio com a fala. A PoYo aceita de 2 a 60 segundos e até 5 MB, enquanto a Hedra lista um intervalo de 2 a 300 segundos, então confira o limite do provedor que você pretende chamar.
  • Um prompt de texto opcional que descreve emoção, gesto ou comportamento da câmera, por exemplo "apresentador calmo, um pequeno aceno de cabeça ao final de cada frase".

A saída é um MP4. A Hedra lista 16:9, 9:16 e 1:1 como proporções compatíveis, o que atende ao YouTube, aos Reels e às publicações quadradas no feed.

Níveis Standard e Pro

Os dois níveis aceitam as mesmas entradas. A diferença está na qualidade da saída e no preço.

StandardPro
Indicado paraGeração em massa, prototipagem rápida, vídeos educativosVídeos de marketing, trabalhos para clientes, conteúdo de destaque
Preço em relação ao outro nívelBaseCerca de 2x o Standard
Endpoint na falfal-ai/kling-video/ai-avatar/v2/standardfal-ai/kling-video/ai-avatar/v2/pro
EntradasImagem, áudio, prompt opcionalIguais

💡 As informações sobre resolução variam por provedor. A APIPass lista 720p para o Standard e 1080p para o Pro, enquanto a Hedra lista 720p nativo para o Pro. Renderize um clipe de teste e verifique o arquivo antes de comprometer um lote.

Preços da API do Kling Avatar 2.0 comparados

É no preço que os provedores mais se diferenciam. A cobrança é por segundo de áudio, então uma narração mais longa custa mais, não importa quão simples seja a foto.

Uma mesa com calculadora, caderno e uma xícara de café vista de cima

Tarifas por segundo por provedor

ProvedorStandardProObservações de cobrança
falUS$ 0,056 por segundoUS$ 0,115 por segundoTarifas conforme informadas pela PoYo e pela Hedra
PoYoUS$ 0,035 por segundo (7 créditos)US$ 0,070 por segundo (14 créditos)Duração do áudio arredondada para o segundo seguinte
Picsart API2 créditos por segundo4 créditos por segundoO preço do crédito depende do seu plano na Picsart
APIPassCréditos por segundoCréditos por segundoOs valores que encontrei eram inconsistentes

A página da PoYo coloca a tarifa Standard cerca de 38% abaixo da da fal, e a tarifa Pro cerca de 39% abaixo, o que bate com a conta: US$ 0,035 contra US$ 0,056, e US$ 0,070 contra US$ 0,115.

💡 Confira antes de orçar. Duas capturas da página de preços da APIPass discordavam por cerca de dez vezes, então deixei a tarifa dela de fora das contas abaixo. Confirme o preço de qualquer provedor no próprio painel antes de enfileirar um lote grande.

Exemplos de custo em volumes reais

A cobrança é linear: segundos de áudio multiplicados pela tarifa. Arredonde cada clipe para cima antes. Uma narração de 12,3 segundos é cobrada como 13 segundos, então na fal Standard custa 13 × US$ 0,056, o que dá US$ 0,73.

Duração do clipefal Standardfal ProPoYo StandardPoYo Pro
10 segundosUS$ 0,56US$ 1,15US$ 0,35US$ 0,70
30 segundosUS$ 1,68US$ 3,45US$ 1,05US$ 2,10
60 segundosUS$ 3,36US$ 6,90US$ 2,10US$ 4,20

É em volume que a diferença cresce. Um lote de 500 clipes de 30 segundos cada são 15.000 segundos de áudio:

Provedor e nível500 clipes de 30 segundos
fal StandardUS$ 840
fal ProUS$ 1.725
PoYo StandardUS$ 525
PoYo ProUS$ 1.050

O Pro compensa o preço mais alto quando um rosto fica na tela por um minuto inteiro, como em um anúncio pago. O Standard é o padrão sensato para clipes de treinamento interno, rascunhos e testes A/B de roteiros.

💡 Reserve margem para refazer. Enquanto você ajusta fotos e prompts, alguns clipes vão precisar de uma segunda renderização. Acrescente uma margem de 20 a 30 por cento à estimativa do primeiro lote e, depois que suas configurações estiverem estáveis, reduza-a.

Formato de requisição e limites

Cada provedor envolve o mesmo modelo em um formato um pouco diferente. Dois exemplos mostram a estrutura.

Um desenvolvedor digitando em uma mesa em pé com dois monitores

Entradas e limites de arquivo

ParâmetroObrigatórioObservações
image_url / imageSimJPEG, PNG ou WebP de até 10 MB. A APIPass também exige pelo menos 300 px e proporção entre 1:2,5 e 2,5:1
audio_url / audioSimMP3, WAV, M4A ou AAC na APIPass; máximo de 5 MB na PoYo e na APIPass
promptNãoO padrão é "." na fal. A APIPass aceita até 2.500 caracteres
modeSomente APIPassstd ou pro

Uma requisição funcional na fal

Na fal, cada nível é um endpoint próprio e o trabalho passa por uma fila. Esta chamada em JavaScript usa o cliente oficial e aguarda o resultado:

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
  input: {
    image_url: "https://example.com/presenter.jpg",
    audio_url: "https://example.com/voiceover.mp3",
    prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
  },
  logs: true,
});

console.log(result.data.video.url, result.data.duration);

Troque o endpoint por fal-ai/kling-video/ai-avatar/v2/pro para o nível Pro. A resposta traz um arquivo video com uma URL de download e um duration em segundos, um número útil para registrar na sua fatura.

A APIPass usa uma única rota de criação de tarefa e um campo mode no lugar:

{
  "model": "kling/avatar-v2",
  "callBackUrl": "https://your-domain.com/api/callback",
  "input": {
    "image": "https://example.com/avatar-image.jpg",
    "audio": "https://example.com/speech-audio.mp3",
    "prompt": "Professional spokesperson with confident gestures",
    "mode": "std"
  }
}

Você envia esse corpo por POST para https://api.apipass.dev/api/v1/jobs/createTask com um token bearer no cabeçalho Authorization, e a resposta devolve um taskId. A PoYo segue o mesmo padrão: uma chamada de envio assíncrona e, depois, um callback por webhook ou consultas de status pelo ID da tarefa.

💡 Use webhooks em produção. As renderizações de avatar são tarefas em fila, não respostas instantâneas. Um webhook deixa seus workers livres, enquanto um loop de consultas gasta requisições enquanto você espera.

Exemplos de lip sync que funcionam

Três configurações mostram onde o preço por segundo se paga.

Vídeos com porta-voz

Uma mulher de blazer cinza-carvão apresentando um pequeno frasco âmbar para a câmera

Uma marca de skincare quer 40 clipes de produto de 20 segundos cada, um por ingrediente. São 800 segundos de áudio. Na fal Standard custa US$ 44,80, na PoYo Pro custa US$ 56 e na fal Pro custa US$ 92. Compare isso com contratar um apresentador e um dia de estúdio para cada variação. O mesmo retrato é reutilizado em todos os clipes, então o rosto permanece consistente em toda a série.

💡 Prompt para testar: "Apresentadora calorosa e confiante, contato visual constante, pequenos acenos de cabeça, ombros relaxados."

Narração de cursos

Um professor gravando uma aula online em um escritório de casa

Uma aula de 10 minutos são 600 segundos de narração. Divida-a em dez segmentos de 60 segundos para que cada um caiba no limite de áudio mais restrito que encontrei e reutilize uma foto para todos eles. Na PoYo Standard a aula custa US$ 21,00, e na fal Standard custa US$ 33,60. Cortar nos limites das frases mantém as emendas invisíveis, porque o falante já está em repouso entre as frases.

Versões multilíngues

Um engenheiro de áudio ajustando um fader enquanto um locutor grava atrás de um vidro

Uma foto mais um roteiro em três idiomas geram três clipes. Com 30 segundos cada na fal Standard, são 90 segundos e US$ 5,04. Gere o áudio de cada idioma com um modelo de texto para fala, como o MiniMax Speech 2.8 HD ou o ElevenLabs V3, e depois envie cada arquivo para o modelo de avatar. Se você já tem um vídeo pronto, o HeyGen Video Translate faz a dublagem diretamente.

Personagens estilizados e animais também funcionam, já que o modelo aceita desenhos animados e rostos não humanos. Teste algumas renderizações antes de construir uma série inteira em torno de uma mascote.

Prepare as entradas para obter melhores resultados

A maioria das renderizações ruins tem origem nas entradas, não no modelo. Corrija isso antes de gastar créditos.

Regras para a foto

Um retrato de frente de um homem de cabelo grisalho curto e camisa azul-marinho

  • Fique de frente para a câmera. Um enquadramento de cabeça e ombros de frente dá ao modelo a maior geometria facial para animar.
  • Mantenha a boca fechada ou neutra. Um sorriso amplo com dentes à mostra na imagem original pode parecer estranho quando os lábios começam a se mover.
  • Mostre as orelhas e a linha do cabelo. Bordas nítidas ajudam a cabeça a manter um contorno estável durante o movimento.
  • Ilumine o rosto de forma uniforme. Luz suave de janela vinda da frente é melhor do que uma sombra lateral dura.
  • Comece com 300 px ou mais no lado menor. Se o seu retrato for pequeno, faça antes o aumento de resolução com o Crystal Upscaler, que foi feito para retratos.

Regras para áudio e prompt

Um homem de barba prateada narrando em um microfone em um canto forrado de espuma

  • Uma voz por arquivo. Vozes sobrepostas não dão à boca nada claro para seguir.
  • Sem música por baixo da voz. Misture a música depois da renderização do avatar.
  • Corte o silêncio nas duas pontas. Você paga por cada segundo de áudio, inclusive o silêncio.
  • Respeite o limite do provedor. O menor teto que encontrei é de 60 segundos, e o mínimo é de 2 segundos.
  • Mantenha o prompt curto. Uma linha sobre emoção, uma sobre gesto e uma sobre câmera bastam. Um prompt longo compete com o áudio em vez de apoiá-lo.

Como usar o Kling Lip Sync

O próprio Kling Avatar 2.0 não está listado no catálogo de lipsync do PicassoIA até a data em que este texto foi escrito. A opção do Kling que está lá, o Kling Lip Sync, resolve um problema parecido: ele combina a boca do falante de um clipe de vídeo existente com uma nova faixa de áudio, ou com um roteiro que você digita. Ele aceita clipes MP4 e MOV de 2 a 10 segundos, de 720p a 1080p.

Uma mulher em um espaço de trabalho iluminado com uma linha do tempo de vídeo no monitor

Passo a passo

  1. Abra a página do Kling Lip Sync no PicassoIA.
  2. Envie seu clipe ou cole o link dele em video_url. Use um MP4 ou MOV de até 100 MB, com 2 a 10 segundos de duração.
  3. Adicione a voz. Envie um arquivo MP3, WAV, M4A ou AAC de até 5 MB em audio_file, ou digite um roteiro em text.
  4. Se você digitou um roteiro, escolha um voice_id na lista em inglês ou chinês e defina voice_speed.
  5. Execute a geração, visualize o resultado e baixe o clipe.

Dicas de parâmetros

  • Use ou áudio ou texto em cada execução. O campo text serve para quando você não tem um arquivo de áudio.
  • voice_id vem com en_AOT por padrão. Ouça duas ou três vozes na mesma linha antes de escolher uma.
  • voice_speed vem em 1 por padrão. Ajuste-o até que o ritmo da fala combine com o ritmo da filmagem.
  • video_url e video_id não podem ser combinados, então escolha uma fonte por execução.
  • Corte cenas mais longas em partes de 10 segundos antes de enviá-las.

Alternativas do PicassoIA para fotos falantes

Quando você começa de uma foto em vez de um vídeo, três modelos do PicassoIA seguem o mesmo padrão de foto mais áudio do Kling Avatar 2.0.

ModeloEntradaVozObservações da saída
Omni Human 1.5Foto, áudio, prompt opcionalSeu áudio, com menos de 35 segundosRostos, planos de corpo inteiro e personagens ilustrados. Modo rápido e seed para resultados repetíveis
Fabric 1.0Foto e áudioSeu áudio480p ou 720p
P Video AvatarFoto, mais um roteiro ou áudioMais de 30 vozes integradas em 10 idiomas720p ou 1080p
Kling Lip SyncVídeo, mais áudio ou textoSeu áudio ou uma voz integradaClipes de 2 a 10 segundos

Um jeito rápido de escolher:

💡 Teste um clipe antes de um lote. Rode o mesmo retrato e os mesmos 10 segundos de áudio em dois modelos e compare o formato da boca nos sons mais difíceis, como "p", "b" e "m".

Experimente seu próprio vídeo de lip sync

Escolha um clipe e teste antes de planejar um lote: um retrato, dez segundos de áudio limpo, um nível. Rode-o no Omni Human 1.5 ou no Fabric 1.0 no Picasso IA, compare o formato da boca com o áudio e guarde as configurações que funcionarem como ponto de partida. Depois, gere o próprio retrato com os modelos de imagem da plataforma, grave ou sintetize a voz e anime tudo. Abra o Picasso IA, envie sua primeira foto e veja até onde podem ir uma única imagem estática e uma gravação curta de voz.

Compartilhe este artigo

Escolha seu idioma