API Kling Avatar 2.0 : tarifs et exemples de synchronisation labiale
Kling Avatar 2.0 transforme une photo et un fichier audio en vidéo parlante. Cet article détaille les tarifs à la seconde de l’API chez fal, PoYo et Picsart, montre une requête fonctionnelle, calcule les coûts sur des durées de clips réelles et compare les modèles de photos parlantes accessibles sur PicassoIA.
Kling Avatar 2.0 prend une photo de portrait et un fichier audio, puis renvoie une vidéo parlante où les lèvres, les yeux et les mouvements de la tête suivent la parole. Le modèle se facture à la seconde d’audio, ce qui rend les tarifs de synchronisation labiale de l’API Kling Avatar 2.0 faciles à prévoir dès que vous savez quel fournisseur vous appelez et quelle offre vous choisissez. Cet article met les chiffres réels côte à côte : 0,056 $ par seconde chez fal, 0,035 $ chez PoYo, 2 crédits chez Picsart, avec des tarifs Pro environ deux fois plus élevés pour chacun. Vous trouverez aussi une requête fonctionnelle, trois exemples de production, des règles sur les entrées qui évitent les mauvais rendus, et un tutoriel pour les modèles de synchronisation labiale les plus comparables sur PicassoIA.
Ce que fait Kling Avatar 2.0
Kling Avatar 2.0 est un modèle d’avatar piloté par l’audio, issu de la famille Kling. Vous lui fournissez une image fixe et un enregistrement de voix, et il anime le visage pour que la forme des lèvres suive les syllabes, que les yeux restent tournés vers l’objectif, et que la tête et les épaules bougent comme celles d’un vrai locuteur. Aucune vidéo filmée ni aucun modèle 3D n’intervient, et l’identité de la personne sur la photo reste stable de la première à la dernière image.
Une photo, un fichier audio
Le contrat d’entrée est simple. Chaque fournisseur que j’ai consulté demande les mêmes trois éléments :
Une image d’une personne, d’un animal, d’un personnage de dessin animé ou stylisé. PoYo accepte les fichiers JPEG, PNG et WebP jusqu’à 10 Mo.
Un fichier audio contenant la parole. PoYo accepte de 2 à 60 secondes et jusqu’à 5 Mo, tandis que Hedra indique une plage de 2 à 300 secondes. Vérifiez donc la limite du fournisseur que vous comptez appeler.
Un prompt texte facultatif qui décrit l’émotion, le geste ou le comportement de la caméra, par exemple « présentateur calme, petit hochement de tête à la fin de chaque phrase ».
La sortie est un fichier MP4. Hedra indique les formats 16:9, 9:16 et 1:1 comme pris en charge, ce qui convient à YouTube, aux Reels et aux publications carrées du fil d’actualité.
Offres Standard et Pro
Les deux offres acceptent les mêmes entrées. La différence porte sur la qualité du rendu et sur le prix.
Standard
Pro
Positionnement
Génération en volume, prototypage rapide, vidéos pédagogiques
Vidéos marketing, travaux pour des clients, contenus phares
Prix par rapport à l’autre offre
Référence
Environ 2 fois le Standard
Point de terminaison fal
fal-ai/kling-video/ai-avatar/v2/standard
fal-ai/kling-video/ai-avatar/v2/pro
Entrées
Image, audio, prompt facultatif
Identiques
💡 Les annonces de résolution varient selon le fournisseur. APIPass annonce du 720p pour le Standard et du 1080p pour le Pro, tandis que Hedra annonce du 720p natif pour le Pro. Générez un clip de test et vérifiez le fichier avant de lancer un lot.
Tarifs de l’API Kling Avatar 2.0 comparés
Le prix est le point où les fournisseurs diffèrent le plus. La facturation se fait à la seconde d’audio : une voix off plus longue coûte donc plus cher, quelle que soit la simplicité de la photo.
Tarifs à la seconde par fournisseur
Fournisseur
Standard
Pro
Remarques sur la facturation
fal
0,056 $ par seconde
0,115 $ par seconde
Tarifs indiqués par PoYo et Hedra
PoYo
0,035 $ par seconde (7 crédits)
0,070 $ par seconde (14 crédits)
Durée audio arrondie à la seconde supérieure
API Picsart
2 crédits par seconde
4 crédits par seconde
Le prix du crédit dépend de votre offre Picsart
APIPass
Crédits par seconde
Crédits par seconde
Les chiffres trouvés étaient incohérents
La page de PoYo place son tarif Standard environ 38 % sous celui de fal, et son tarif Pro environ 39 % en dessous, ce qui correspond au calcul : 0,035 $ face à 0,056 $, et 0,070 $ face à 0,115 $.
💡 Vérifiez avant de budgétiser. Deux relevés de la page tarifaire d’APIPass ne concordaient pas, avec un écart d’environ dix fois. J’ai donc exclu son tarif du calcul ci-dessous. Confirmez le prix de chaque fournisseur dans son propre tableau de bord avant de lancer un gros lot.
Exemples de coûts sur des volumes réels
La facturation est linéaire : secondes d’audio multipliées par le tarif. Arrondissez d’abord chaque clip à la seconde supérieure. Une voix off de 12,3 secondes est facturée 13 secondes, soit sur fal Standard 13 × 0,056 $, c’est-à-dire 0,73 $.
Durée du clip
fal Standard
fal Pro
PoYo Standard
PoYo Pro
10 secondes
0,56 $
1,15 $
0,35 $
0,70 $
30 secondes
1,68 $
3,45 $
1,05 $
2,10 $
60 secondes
3,36 $
6,90 $
2,10 $
4,20 $
C’est en volume que l’écart se creuse. Un lot de 500 clips de 30 secondes chacun représente 15 000 secondes d’audio :
Fournisseur et offre
500 clips de 30 secondes
fal Standard
840 $
fal Pro
1 725 $
PoYo Standard
525 $
PoYo Pro
1 050 $
L’offre Pro se justifie lorsqu’un visage reste à l’écran pendant une minute entière, comme dans une publicité payante. Le Standard est le choix raisonnable pour les vidéos de formation internes, les brouillons et les tests A/B de scripts.
💡 Prévoyez des reprises. Pendant que vous ajustez les photos et les prompts, certains clips demanderont un second rendu. Ajoutez une marge de 20 à 30 % à votre première estimation de lot, puis réduisez-la une fois vos réglages stables.
Format des requêtes et limites
Chaque fournisseur encapsule le même modèle dans une enveloppe légèrement différente. Deux exemples montrent la forme générale.
Entrées et limites de fichiers
Paramètre
Obligatoire
Remarques
image_url / image
Oui
JPEG, PNG ou WebP jusqu’à 10 Mo. APIPass demande aussi au moins 300 px et un format compris entre 1:2,5 et 2,5:1
audio_url / audio
Oui
MP3, WAV, M4A ou AAC chez APIPass, 5 Mo maximum chez PoYo et APIPass
prompt
Non
Valeur par défaut « . » chez fal. APIPass accepte jusqu’à 2 500 caractères
mode
APIPass uniquement
std ou pro
Une requête fal fonctionnelle
Chez fal, chaque offre a son propre point de terminaison et la tâche passe par une file d’attente. Cet appel JavaScript utilise le client officiel et attend le résultat :
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
input: {
image_url: "https://example.com/presenter.jpg",
audio_url: "https://example.com/voiceover.mp3",
prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
},
logs: true,
});
console.log(result.data.video.url, result.data.duration);
Remplacez le point de terminaison par fal-ai/kling-video/ai-avatar/v2/pro pour l’offre Pro. La réponse contient un fichier video avec une URL de téléchargement, ainsi qu’une duration en secondes, un chiffre pratique à reporter sur votre facture.
APIPass utilise une seule route de création de tâche, avec un champ mode à la place :
Vous envoyez ce corps en POST vers https://api.apipass.dev/api/v1/jobs/createTask avec un jeton bearer dans l’en-tête Authorization, et la réponse renvoie un taskId. PoYo suit le même schéma : un appel de soumission asynchrone, puis soit un callback webhook, soit une interrogation du statut par identifiant de tâche.
💡 Utilisez les webhooks en production. Les rendus d’avatar sont des tâches mises en file d’attente, et non des réponses instantanées. Un webhook libère vos workers, alors qu’une boucle d’interrogation consomme des requêtes pendant l’attente.
Des exemples de synchronisation labiale qui fonctionnent
Trois configurations montrent où le prix à la seconde se rentabilise.
Vidéos de porte-parole
Une marque de soins pour la peau veut 40 clips de produit de 20 secondes chacun, un par ingrédient. Cela fait 800 secondes d’audio. Sur fal Standard, le coût est de 44,80 $, sur PoYo Pro de 56 $, et sur fal Pro de 92 $. Comparez avec la réservation d’un présentateur et d’une journée de studio pour chaque variante. Le même portrait est réutilisé pour chaque clip, ce qui garde le visage cohérent sur toute la série.
💡 Prompt à essayer : « Présentateur chaleureux et sûr de lui, contact visuel constant, petits hochements de tête, épaules détendues. »
Narration de cours
Une leçon de 10 minutes représente 600 secondes de narration. Découpez-la en dix segments de 60 secondes, afin que chacun respecte la limite audio la plus stricte que j’ai trouvée, puis réutilisez une seule photo pour tous. Chez PoYo Standard, la leçon coûte 21,00 $, et chez fal Standard, 33,60 $. Couper aux limites des phrases rend les raccords invisibles, car le locuteur est déjà au repos entre deux phrases.
Versions multilingues
Une photo et un script dans trois langues donnent trois clips. À 30 secondes chacun sur fal Standard, cela fait 90 secondes et 5,04 $. Générez l’audio de chaque langue avec un modèle de synthèse vocale comme MiniMax Speech 2.8 HD ou ElevenLabs V3, puis transmettez chaque fichier au modèle d’avatar. Si vous disposez déjà d’une vidéo finalisée, HeyGen Video Translate la double directement.
Les personnages stylisés et les animaux fonctionnent aussi, puisque le modèle accepte les dessins animés et les visages non humains. Testez quelques rendus avant de construire une série entière autour d’une mascotte.
Préparer les entrées pour de meilleurs résultats
La plupart des mauvais rendus viennent des entrées, et non du modèle. Corrigez-les avant de dépenser des crédits.
Règles pour la photo
Regardez la caméra. Un cadrage de la tête et des épaules, droit face à l’objectif, donne au modèle le plus de géométrie faciale à animer.
Gardez la bouche fermée ou neutre. Un large sourire avec les dents visibles sur la photo source peut paraître étrange dès que les lèvres bougent.
Montrez les oreilles et la naissance des cheveux. Des contours nets aident la tête à garder une silhouette stable pendant le mouvement.
Éclairez le visage uniformément. Une lumière douce venant d’une fenêtre, de face, vaut mieux qu’une ombre dure sur le côté.
Partez d’au moins 300 px sur le petit côté. Si votre portrait est petit, augmentez d’abord sa résolution avec Crystal Upscaler, conçu pour les portraits.
Règles pour l’audio et le prompt
Une seule voix par fichier. Des voix qui se superposent ne donnent à la bouche aucun repère clair à suivre.
Pas de musique sous la voix. Mixez la musique après le rendu de l’avatar.
Coupez les silences aux deux extrémités. Vous payez chaque seconde d’audio, y compris les blancs.
Restez dans la limite du fournisseur. La plus petite limite que j’ai trouvée est de 60 secondes, et le minimum est de 2 secondes.
Gardez un prompt court. Une ligne sur l’émotion, une sur le geste et une sur la caméra suffisent. Un prompt long entre en concurrence avec l’audio au lieu de le soutenir.
Comment utiliser Kling Lip Sync
Kling Avatar 2.0 lui-même ne figure pas dans le catalogue de synchronisation labiale de PicassoIA au moment de la rédaction. L’option Kling qui s’y trouve, Kling Lip Sync, répond à un problème voisin : elle fait correspondre la bouche du locuteur d’un clip vidéo existant à une nouvelle piste audio, ou à un script que vous saisissez. Elle accepte des clips MP4 et MOV de 2 à 10 secondes, en 720p à 1080p.
Vous avez une photo et seulement un script :P Video Avatar rédige la voix à votre place.
Vous avez des images et besoin d’un nouvel audio :Kling Lip Sync est l’outil approprié.
Vous avez d’abord besoin d’une voix :Realtime TTS 2 et ElevenLabs V3 produisent un audio que vous pouvez transmettre à n’importe lequel des modèles ci-dessus.
💡 Testez un clip avant un lot. Lancez le même portrait et les mêmes 10 secondes d’audio sur deux modèles, puis comparez la forme de la bouche sur les sons difficiles comme « p », « b » et « m ».
Essayez votre propre vidéo de synchronisation labiale
Choisissez un clip et testez-le avant de planifier un lot : un portrait, dix secondes d’audio propre, une seule offre. Passez-le dans Omni Human 1.5 ou Fabric 1.0 sur Picasso IA, comparez la forme des bouches avec l’audio, et gardez les réglages qui fonctionnent comme modèle de référence. Générez ensuite le portrait lui-même avec les modèles d’image de la plateforme, enregistrez ou synthétisez la voix, puis animez le tout. Ouvrez Picasso IA, importez votre première photo et voyez jusqu’où une seule image fixe et un court enregistrement de voix peuvent aller.