API do Kling Avatar 2.0: preços de lip sync e exemplos
O Kling Avatar 2.0 transforma uma foto e um arquivo de áudio em um vídeo falado. Este artigo lista os preços por segundo da API na fal, na PoYo e na Picsart, mostra uma requisição funcional, faz as contas de custo com durações reais de clipes e compara modelos de foto falante que você pode usar no PicassoIA.
O Kling Avatar 2.0 recebe uma foto de retrato e um arquivo de áudio e devolve um vídeo falado, em que os lábios, os olhos e o movimento da cabeça acompanham a fala. O modelo é cobrado por segundo de áudio, o que torna os preços de lip sync da API do Kling Avatar 2.0 fáceis de prever, desde que você saiba qual provedor vai chamar e qual nível escolher. Este artigo coloca os números reais lado a lado: US$ 0,056 por segundo na fal, US$ 0,035 na PoYo e 2 créditos na Picsart, com as tarifas Pro cerca de duas vezes maiores em cada uma delas. Você também recebe uma requisição funcional, três exemplos no estilo de produção, regras de entrada que evitam renderizações ruins e um tutorial com os modelos de lip sync mais parecidos disponíveis no PicassoIA.
O que o Kling Avatar 2.0 faz
O Kling Avatar 2.0 é um modelo de avatar guiado por áudio da família Kling. Você entrega uma imagem estática e uma gravação de fala, e ele anima o rosto para que o formato da boca acompanhe as sílabas, os olhos mantenham contato com a lente e a cabeça e os ombros se movam como os de um falante real. Não há filmagem nem esqueleto 3D envolvidos, e a identidade da pessoa na foto permanece estável do primeiro ao último quadro.
Uma foto, um arquivo de áudio
O contrato de entrada é curto. Todos os provedores que verifiquei pedem as mesmas três coisas:
Uma imagem de uma pessoa, animal, desenho animado ou personagem estilizado. A PoYo aceita arquivos JPEG, PNG e WebP de até 10 MB.
Um arquivo de áudio com a fala. A PoYo aceita de 2 a 60 segundos e até 5 MB, enquanto a Hedra lista um intervalo de 2 a 300 segundos, então confira o limite do provedor que você pretende chamar.
Um prompt de texto opcional que descreve emoção, gesto ou comportamento da câmera, por exemplo "apresentador calmo, um pequeno aceno de cabeça ao final de cada frase".
A saída é um MP4. A Hedra lista 16:9, 9:16 e 1:1 como proporções compatíveis, o que atende ao YouTube, aos Reels e às publicações quadradas no feed.
Níveis Standard e Pro
Os dois níveis aceitam as mesmas entradas. A diferença está na qualidade da saída e no preço.
Standard
Pro
Indicado para
Geração em massa, prototipagem rápida, vídeos educativos
Vídeos de marketing, trabalhos para clientes, conteúdo de destaque
Preço em relação ao outro nível
Base
Cerca de 2x o Standard
Endpoint na fal
fal-ai/kling-video/ai-avatar/v2/standard
fal-ai/kling-video/ai-avatar/v2/pro
Entradas
Imagem, áudio, prompt opcional
Iguais
💡 As informações sobre resolução variam por provedor. A APIPass lista 720p para o Standard e 1080p para o Pro, enquanto a Hedra lista 720p nativo para o Pro. Renderize um clipe de teste e verifique o arquivo antes de comprometer um lote.
Preços da API do Kling Avatar 2.0 comparados
É no preço que os provedores mais se diferenciam. A cobrança é por segundo de áudio, então uma narração mais longa custa mais, não importa quão simples seja a foto.
Tarifas por segundo por provedor
Provedor
Standard
Pro
Observações de cobrança
fal
US$ 0,056 por segundo
US$ 0,115 por segundo
Tarifas conforme informadas pela PoYo e pela Hedra
PoYo
US$ 0,035 por segundo (7 créditos)
US$ 0,070 por segundo (14 créditos)
Duração do áudio arredondada para o segundo seguinte
Picsart API
2 créditos por segundo
4 créditos por segundo
O preço do crédito depende do seu plano na Picsart
APIPass
Créditos por segundo
Créditos por segundo
Os valores que encontrei eram inconsistentes
A página da PoYo coloca a tarifa Standard cerca de 38% abaixo da da fal, e a tarifa Pro cerca de 39% abaixo, o que bate com a conta: US$ 0,035 contra US$ 0,056, e US$ 0,070 contra US$ 0,115.
💡 Confira antes de orçar. Duas capturas da página de preços da APIPass discordavam por cerca de dez vezes, então deixei a tarifa dela de fora das contas abaixo. Confirme o preço de qualquer provedor no próprio painel antes de enfileirar um lote grande.
Exemplos de custo em volumes reais
A cobrança é linear: segundos de áudio multiplicados pela tarifa. Arredonde cada clipe para cima antes. Uma narração de 12,3 segundos é cobrada como 13 segundos, então na fal Standard custa 13 × US$ 0,056, o que dá US$ 0,73.
Duração do clipe
fal Standard
fal Pro
PoYo Standard
PoYo Pro
10 segundos
US$ 0,56
US$ 1,15
US$ 0,35
US$ 0,70
30 segundos
US$ 1,68
US$ 3,45
US$ 1,05
US$ 2,10
60 segundos
US$ 3,36
US$ 6,90
US$ 2,10
US$ 4,20
É em volume que a diferença cresce. Um lote de 500 clipes de 30 segundos cada são 15.000 segundos de áudio:
Provedor e nível
500 clipes de 30 segundos
fal Standard
US$ 840
fal Pro
US$ 1.725
PoYo Standard
US$ 525
PoYo Pro
US$ 1.050
O Pro compensa o preço mais alto quando um rosto fica na tela por um minuto inteiro, como em um anúncio pago. O Standard é o padrão sensato para clipes de treinamento interno, rascunhos e testes A/B de roteiros.
💡 Reserve margem para refazer. Enquanto você ajusta fotos e prompts, alguns clipes vão precisar de uma segunda renderização. Acrescente uma margem de 20 a 30 por cento à estimativa do primeiro lote e, depois que suas configurações estiverem estáveis, reduza-a.
Formato de requisição e limites
Cada provedor envolve o mesmo modelo em um formato um pouco diferente. Dois exemplos mostram a estrutura.
Entradas e limites de arquivo
Parâmetro
Obrigatório
Observações
image_url / image
Sim
JPEG, PNG ou WebP de até 10 MB. A APIPass também exige pelo menos 300 px e proporção entre 1:2,5 e 2,5:1
audio_url / audio
Sim
MP3, WAV, M4A ou AAC na APIPass; máximo de 5 MB na PoYo e na APIPass
prompt
Não
O padrão é "." na fal. A APIPass aceita até 2.500 caracteres
mode
Somente APIPass
std ou pro
Uma requisição funcional na fal
Na fal, cada nível é um endpoint próprio e o trabalho passa por uma fila. Esta chamada em JavaScript usa o cliente oficial e aguarda o resultado:
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
input: {
image_url: "https://example.com/presenter.jpg",
audio_url: "https://example.com/voiceover.mp3",
prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
},
logs: true,
});
console.log(result.data.video.url, result.data.duration);
Troque o endpoint por fal-ai/kling-video/ai-avatar/v2/pro para o nível Pro. A resposta traz um arquivo video com uma URL de download e um duration em segundos, um número útil para registrar na sua fatura.
A APIPass usa uma única rota de criação de tarefa e um campo mode no lugar:
Você envia esse corpo por POST para https://api.apipass.dev/api/v1/jobs/createTask com um token bearer no cabeçalho Authorization, e a resposta devolve um taskId. A PoYo segue o mesmo padrão: uma chamada de envio assíncrona e, depois, um callback por webhook ou consultas de status pelo ID da tarefa.
💡 Use webhooks em produção. As renderizações de avatar são tarefas em fila, não respostas instantâneas. Um webhook deixa seus workers livres, enquanto um loop de consultas gasta requisições enquanto você espera.
Exemplos de lip sync que funcionam
Três configurações mostram onde o preço por segundo se paga.
Vídeos com porta-voz
Uma marca de skincare quer 40 clipes de produto de 20 segundos cada, um por ingrediente. São 800 segundos de áudio. Na fal Standard custa US$ 44,80, na PoYo Pro custa US$ 56 e na fal Pro custa US$ 92. Compare isso com contratar um apresentador e um dia de estúdio para cada variação. O mesmo retrato é reutilizado em todos os clipes, então o rosto permanece consistente em toda a série.
💡 Prompt para testar: "Apresentadora calorosa e confiante, contato visual constante, pequenos acenos de cabeça, ombros relaxados."
Narração de cursos
Uma aula de 10 minutos são 600 segundos de narração. Divida-a em dez segmentos de 60 segundos para que cada um caiba no limite de áudio mais restrito que encontrei e reutilize uma foto para todos eles. Na PoYo Standard a aula custa US$ 21,00, e na fal Standard custa US$ 33,60. Cortar nos limites das frases mantém as emendas invisíveis, porque o falante já está em repouso entre as frases.
Versões multilíngues
Uma foto mais um roteiro em três idiomas geram três clipes. Com 30 segundos cada na fal Standard, são 90 segundos e US$ 5,04. Gere o áudio de cada idioma com um modelo de texto para fala, como o MiniMax Speech 2.8 HD ou o ElevenLabs V3, e depois envie cada arquivo para o modelo de avatar. Se você já tem um vídeo pronto, o HeyGen Video Translate faz a dublagem diretamente.
Personagens estilizados e animais também funcionam, já que o modelo aceita desenhos animados e rostos não humanos. Teste algumas renderizações antes de construir uma série inteira em torno de uma mascote.
Prepare as entradas para obter melhores resultados
A maioria das renderizações ruins tem origem nas entradas, não no modelo. Corrija isso antes de gastar créditos.
Regras para a foto
Fique de frente para a câmera. Um enquadramento de cabeça e ombros de frente dá ao modelo a maior geometria facial para animar.
Mantenha a boca fechada ou neutra. Um sorriso amplo com dentes à mostra na imagem original pode parecer estranho quando os lábios começam a se mover.
Mostre as orelhas e a linha do cabelo. Bordas nítidas ajudam a cabeça a manter um contorno estável durante o movimento.
Ilumine o rosto de forma uniforme. Luz suave de janela vinda da frente é melhor do que uma sombra lateral dura.
Comece com 300 px ou mais no lado menor. Se o seu retrato for pequeno, faça antes o aumento de resolução com o Crystal Upscaler, que foi feito para retratos.
Regras para áudio e prompt
Uma voz por arquivo. Vozes sobrepostas não dão à boca nada claro para seguir.
Sem música por baixo da voz. Misture a música depois da renderização do avatar.
Corte o silêncio nas duas pontas. Você paga por cada segundo de áudio, inclusive o silêncio.
Respeite o limite do provedor. O menor teto que encontrei é de 60 segundos, e o mínimo é de 2 segundos.
Mantenha o prompt curto. Uma linha sobre emoção, uma sobre gesto e uma sobre câmera bastam. Um prompt longo compete com o áudio em vez de apoiá-lo.
Como usar o Kling Lip Sync
O próprio Kling Avatar 2.0 não está listado no catálogo de lipsync do PicassoIA até a data em que este texto foi escrito. A opção do Kling que está lá, o Kling Lip Sync, resolve um problema parecido: ele combina a boca do falante de um clipe de vídeo existente com uma nova faixa de áudio, ou com um roteiro que você digita. Ele aceita clipes MP4 e MOV de 2 a 10 segundos, de 720p a 1080p.
Você tem uma foto e só um roteiro: o P Video Avatar cria a voz para você.
Você tem filmagem e precisa de um novo áudio: o Kling Lip Sync é a ferramenta certa.
Você precisa de uma voz primeiro: o Realtime TTS 2 e o ElevenLabs V3 produzem áudio que você pode enviar para qualquer um dos modelos acima.
💡 Teste um clipe antes de um lote. Rode o mesmo retrato e os mesmos 10 segundos de áudio em dois modelos e compare o formato da boca nos sons mais difíceis, como "p", "b" e "m".
Experimente seu próprio vídeo de lip sync
Escolha um clipe e teste antes de planejar um lote: um retrato, dez segundos de áudio limpo, um nível. Rode-o no Omni Human 1.5 ou no Fabric 1.0 no Picasso IA, compare o formato da boca com o áudio e guarde as configurações que funcionarem como ponto de partida. Depois, gere o próprio retrato com os modelos de imagem da plataforma, grave ou sintetize a voz e anime tudo. Abra o Picasso IA, envie sua primeira foto e veja até onde podem ir uma única imagem estática e uma gravação curta de voz.