API Kling Avatar 2.0 : tarifs et exemples de synchronisation labiale

Kling Avatar 2.0 transforme une photo et un fichier audio en vidéo parlante. Cet article détaille les tarifs à la seconde de l’API chez fal, PoYo et Picsart, montre une requête fonctionnelle, calcule les coûts sur des durées de clips réelles et compare les modèles de photos parlantes accessibles sur PicassoIA.

API Kling Avatar 2.0 : tarifs et exemples de synchronisation labiale
Cristian Da Conceicao
Fondateur de Picasso IA

Kling Avatar 2.0 prend une photo de portrait et un fichier audio, puis renvoie une vidéo parlante où les lèvres, les yeux et les mouvements de la tête suivent la parole. Le modèle se facture à la seconde d’audio, ce qui rend les tarifs de synchronisation labiale de l’API Kling Avatar 2.0 faciles à prévoir dès que vous savez quel fournisseur vous appelez et quelle offre vous choisissez. Cet article met les chiffres réels côte à côte : 0,056 $ par seconde chez fal, 0,035 $ chez PoYo, 2 crédits chez Picsart, avec des tarifs Pro environ deux fois plus élevés pour chacun. Vous trouverez aussi une requête fonctionnelle, trois exemples de production, des règles sur les entrées qui évitent les mauvais rendus, et un tutoriel pour les modèles de synchronisation labiale les plus comparables sur PicassoIA.

Ce que fait Kling Avatar 2.0

Kling Avatar 2.0 est un modèle d’avatar piloté par l’audio, issu de la famille Kling. Vous lui fournissez une image fixe et un enregistrement de voix, et il anime le visage pour que la forme des lèvres suive les syllabes, que les yeux restent tournés vers l’objectif, et que la tête et les épaules bougent comme celles d’un vrai locuteur. Aucune vidéo filmée ni aucun modèle 3D n’intervient, et l’identité de la personne sur la photo reste stable de la première à la dernière image.

Un photographe éclairant un portrait en studio d’une femme souriante en blazer bleu marine

Une photo, un fichier audio

Le contrat d’entrée est simple. Chaque fournisseur que j’ai consulté demande les mêmes trois éléments :

  • Une image d’une personne, d’un animal, d’un personnage de dessin animé ou stylisé. PoYo accepte les fichiers JPEG, PNG et WebP jusqu’à 10 Mo.
  • Un fichier audio contenant la parole. PoYo accepte de 2 à 60 secondes et jusqu’à 5 Mo, tandis que Hedra indique une plage de 2 à 300 secondes. Vérifiez donc la limite du fournisseur que vous comptez appeler.
  • Un prompt texte facultatif qui décrit l’émotion, le geste ou le comportement de la caméra, par exemple « présentateur calme, petit hochement de tête à la fin de chaque phrase ».

La sortie est un fichier MP4. Hedra indique les formats 16:9, 9:16 et 1:1 comme pris en charge, ce qui convient à YouTube, aux Reels et aux publications carrées du fil d’actualité.

Offres Standard et Pro

Les deux offres acceptent les mêmes entrées. La différence porte sur la qualité du rendu et sur le prix.

StandardPro
PositionnementGénération en volume, prototypage rapide, vidéos pédagogiquesVidéos marketing, travaux pour des clients, contenus phares
Prix par rapport à l’autre offreRéférenceEnviron 2 fois le Standard
Point de terminaison falfal-ai/kling-video/ai-avatar/v2/standardfal-ai/kling-video/ai-avatar/v2/pro
EntréesImage, audio, prompt facultatifIdentiques

💡 Les annonces de résolution varient selon le fournisseur. APIPass annonce du 720p pour le Standard et du 1080p pour le Pro, tandis que Hedra annonce du 720p natif pour le Pro. Générez un clip de test et vérifiez le fichier avant de lancer un lot.

Tarifs de l’API Kling Avatar 2.0 comparés

Le prix est le point où les fournisseurs diffèrent le plus. La facturation se fait à la seconde d’audio : une voix off plus longue coûte donc plus cher, quelle que soit la simplicité de la photo.

Un bureau vu d’en haut avec une calculatrice, un carnet et une tasse d’expresso

Tarifs à la seconde par fournisseur

FournisseurStandardProRemarques sur la facturation
fal0,056 $ par seconde0,115 $ par secondeTarifs indiqués par PoYo et Hedra
PoYo0,035 $ par seconde (7 crédits)0,070 $ par seconde (14 crédits)Durée audio arrondie à la seconde supérieure
API Picsart2 crédits par seconde4 crédits par secondeLe prix du crédit dépend de votre offre Picsart
APIPassCrédits par secondeCrédits par secondeLes chiffres trouvés étaient incohérents

La page de PoYo place son tarif Standard environ 38 % sous celui de fal, et son tarif Pro environ 39 % en dessous, ce qui correspond au calcul : 0,035 $ face à 0,056 $, et 0,070 $ face à 0,115 $.

💡 Vérifiez avant de budgétiser. Deux relevés de la page tarifaire d’APIPass ne concordaient pas, avec un écart d’environ dix fois. J’ai donc exclu son tarif du calcul ci-dessous. Confirmez le prix de chaque fournisseur dans son propre tableau de bord avant de lancer un gros lot.

Exemples de coûts sur des volumes réels

La facturation est linéaire : secondes d’audio multipliées par le tarif. Arrondissez d’abord chaque clip à la seconde supérieure. Une voix off de 12,3 secondes est facturée 13 secondes, soit sur fal Standard 13 × 0,056 $, c’est-à-dire 0,73 $.

Durée du clipfal Standardfal ProPoYo StandardPoYo Pro
10 secondes0,56 $1,15 $0,35 $0,70 $
30 secondes1,68 $3,45 $1,05 $2,10 $
60 secondes3,36 $6,90 $2,10 $4,20 $

C’est en volume que l’écart se creuse. Un lot de 500 clips de 30 secondes chacun représente 15 000 secondes d’audio :

Fournisseur et offre500 clips de 30 secondes
fal Standard840 $
fal Pro1 725 $
PoYo Standard525 $
PoYo Pro1 050 $

L’offre Pro se justifie lorsqu’un visage reste à l’écran pendant une minute entière, comme dans une publicité payante. Le Standard est le choix raisonnable pour les vidéos de formation internes, les brouillons et les tests A/B de scripts.

💡 Prévoyez des reprises. Pendant que vous ajustez les photos et les prompts, certains clips demanderont un second rendu. Ajoutez une marge de 20 à 30 % à votre première estimation de lot, puis réduisez-la une fois vos réglages stables.

Format des requêtes et limites

Chaque fournisseur encapsule le même modèle dans une enveloppe légèrement différente. Deux exemples montrent la forme générale.

Un développeur tapant sur un clavier, debout devant un bureau à deux écrans

Entrées et limites de fichiers

ParamètreObligatoireRemarques
image_url / imageOuiJPEG, PNG ou WebP jusqu’à 10 Mo. APIPass demande aussi au moins 300 px et un format compris entre 1:2,5 et 2,5:1
audio_url / audioOuiMP3, WAV, M4A ou AAC chez APIPass, 5 Mo maximum chez PoYo et APIPass
promptNonValeur par défaut « . » chez fal. APIPass accepte jusqu’à 2 500 caractères
modeAPIPass uniquementstd ou pro

Une requête fal fonctionnelle

Chez fal, chaque offre a son propre point de terminaison et la tâche passe par une file d’attente. Cet appel JavaScript utilise le client officiel et attend le résultat :

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
  input: {
    image_url: "https://example.com/presenter.jpg",
    audio_url: "https://example.com/voiceover.mp3",
    prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
  },
  logs: true,
});

console.log(result.data.video.url, result.data.duration);

Remplacez le point de terminaison par fal-ai/kling-video/ai-avatar/v2/pro pour l’offre Pro. La réponse contient un fichier video avec une URL de téléchargement, ainsi qu’une duration en secondes, un chiffre pratique à reporter sur votre facture.

APIPass utilise une seule route de création de tâche, avec un champ mode à la place :

{
  "model": "kling/avatar-v2",
  "callBackUrl": "https://your-domain.com/api/callback",
  "input": {
    "image": "https://example.com/avatar-image.jpg",
    "audio": "https://example.com/speech-audio.mp3",
    "prompt": "Professional spokesperson with confident gestures",
    "mode": "std"
  }
}

Vous envoyez ce corps en POST vers https://api.apipass.dev/api/v1/jobs/createTask avec un jeton bearer dans l’en-tête Authorization, et la réponse renvoie un taskId. PoYo suit le même schéma : un appel de soumission asynchrone, puis soit un callback webhook, soit une interrogation du statut par identifiant de tâche.

💡 Utilisez les webhooks en production. Les rendus d’avatar sont des tâches mises en file d’attente, et non des réponses instantanées. Un webhook libère vos workers, alors qu’une boucle d’interrogation consomme des requêtes pendant l’attente.

Des exemples de synchronisation labiale qui fonctionnent

Trois configurations montrent où le prix à la seconde se rentabilise.

Vidéos de porte-parole

Une femme en blazer anthracite présentant un petit flacon ambré face à la caméra

Une marque de soins pour la peau veut 40 clips de produit de 20 secondes chacun, un par ingrédient. Cela fait 800 secondes d’audio. Sur fal Standard, le coût est de 44,80 $, sur PoYo Pro de 56 $, et sur fal Pro de 92 $. Comparez avec la réservation d’un présentateur et d’une journée de studio pour chaque variante. Le même portrait est réutilisé pour chaque clip, ce qui garde le visage cohérent sur toute la série.

💡 Prompt à essayer : « Présentateur chaleureux et sûr de lui, contact visuel constant, petits hochements de tête, épaules détendues. »

Narration de cours

Un enseignant enregistrant une leçon en ligne dans un coin de travail à domicile

Une leçon de 10 minutes représente 600 secondes de narration. Découpez-la en dix segments de 60 secondes, afin que chacun respecte la limite audio la plus stricte que j’ai trouvée, puis réutilisez une seule photo pour tous. Chez PoYo Standard, la leçon coûte 21,00 $, et chez fal Standard, 33,60 $. Couper aux limites des phrases rend les raccords invisibles, car le locuteur est déjà au repos entre deux phrases.

Versions multilingues

Un ingénieur du son ajustant un potentiomètre pendant qu’un locuteur enregistre derrière une vitre

Une photo et un script dans trois langues donnent trois clips. À 30 secondes chacun sur fal Standard, cela fait 90 secondes et 5,04 $. Générez l’audio de chaque langue avec un modèle de synthèse vocale comme MiniMax Speech 2.8 HD ou ElevenLabs V3, puis transmettez chaque fichier au modèle d’avatar. Si vous disposez déjà d’une vidéo finalisée, HeyGen Video Translate la double directement.

Les personnages stylisés et les animaux fonctionnent aussi, puisque le modèle accepte les dessins animés et les visages non humains. Testez quelques rendus avant de construire une série entière autour d’une mascotte.

Préparer les entrées pour de meilleurs résultats

La plupart des mauvais rendus viennent des entrées, et non du modèle. Corrigez-les avant de dépenser des crédits.

Règles pour la photo

Un portrait de face d’un homme aux cheveux gris courts et chemise bleu marine

  • Regardez la caméra. Un cadrage de la tête et des épaules, droit face à l’objectif, donne au modèle le plus de géométrie faciale à animer.
  • Gardez la bouche fermée ou neutre. Un large sourire avec les dents visibles sur la photo source peut paraître étrange dès que les lèvres bougent.
  • Montrez les oreilles et la naissance des cheveux. Des contours nets aident la tête à garder une silhouette stable pendant le mouvement.
  • Éclairez le visage uniformément. Une lumière douce venant d’une fenêtre, de face, vaut mieux qu’une ombre dure sur le côté.
  • Partez d’au moins 300 px sur le petit côté. Si votre portrait est petit, augmentez d’abord sa résolution avec Crystal Upscaler, conçu pour les portraits.

Règles pour l’audio et le prompt

Un homme à barbe argentée narrant dans un micro, dans un coin tapissé de mousse

  • Une seule voix par fichier. Des voix qui se superposent ne donnent à la bouche aucun repère clair à suivre.
  • Pas de musique sous la voix. Mixez la musique après le rendu de l’avatar.
  • Coupez les silences aux deux extrémités. Vous payez chaque seconde d’audio, y compris les blancs.
  • Restez dans la limite du fournisseur. La plus petite limite que j’ai trouvée est de 60 secondes, et le minimum est de 2 secondes.
  • Gardez un prompt court. Une ligne sur l’émotion, une sur le geste et une sur la caméra suffisent. Un prompt long entre en concurrence avec l’audio au lieu de le soutenir.

Comment utiliser Kling Lip Sync

Kling Avatar 2.0 lui-même ne figure pas dans le catalogue de synchronisation labiale de PicassoIA au moment de la rédaction. L’option Kling qui s’y trouve, Kling Lip Sync, répond à un problème voisin : elle fait correspondre la bouche du locuteur d’un clip vidéo existant à une nouvelle piste audio, ou à un script que vous saisissez. Elle accepte des clips MP4 et MOV de 2 à 10 secondes, en 720p à 1080p.

Une femme dans un espace de travail lumineux, avec une timeline vidéo sur son écran

Étape par étape

  1. Ouvrez la page Kling Lip Sync sur PicassoIA.
  2. Importez votre clip ou collez son lien dans video_url. Utilisez un fichier MP4 ou MOV de moins de 100 Mo, d’une durée de 2 à 10 secondes.
  3. Ajoutez la voix. Importez soit un fichier MP3, WAV, M4A ou AAC de moins de 5 Mo dans audio_file, soit saisissez un script dans text.
  4. Si vous avez saisi un script, choisissez une voice_id dans la liste anglaise ou chinoise, puis réglez voice_speed.
  5. Lancez la génération, prévisualisez le résultat et téléchargez le clip.

Conseils sur les paramètres

  • Utilisez soit l’audio, soit le texte pour une exécution donnée. Le champ text sert lorsque vous n’avez pas de fichier audio.
  • voice_id vaut en_AOT par défaut. Écoutez deux ou trois voix sur la même ligne avant d’en choisir une.
  • voice_speed vaut 1 par défaut. Ajustez-le jusqu’à ce que le rythme de la parole corresponde à celui des images.
  • video_url et video_id ne peuvent pas être combinés, donc choisissez une seule source par exécution.
  • Découpez les scènes plus longues en morceaux de 10 secondes avant de les importer.

Alternatives sur PicassoIA pour les photos parlantes

Lorsque vous partez d’une photo plutôt que d’une vidéo, trois modèles de PicassoIA suivent le même schéma photo plus audio que Kling Avatar 2.0.

ModèleEntréeVoixRemarques sur la sortie
Omni Human 1.5Photo, audio, prompt facultatifVotre audio, de moins de 35 secondesVisages, plans en pied et personnages illustrés. Mode rapide et seed pour des résultats reproductibles
Fabric 1.0Photo et audioVotre audio480p ou 720p
P Video AvatarPhoto, plus un script ou un audioPlus de 30 voix intégrées en 10 langues720p ou 1080p
Kling Lip SyncVidéo, plus audio ou texteVotre audio ou une voix intégréeClips de 2 à 10 secondes

Une façon rapide de choisir :

  • Vous avez une photo et une voix enregistrée : commencez par Omni Human 1.5 ou Fabric 1.0.
  • Vous avez une photo et seulement un script : P Video Avatar rédige la voix à votre place.
  • Vous avez des images et besoin d’un nouvel audio : Kling Lip Sync est l’outil approprié.
  • Vous avez d’abord besoin d’une voix : Realtime TTS 2 et ElevenLabs V3 produisent un audio que vous pouvez transmettre à n’importe lequel des modèles ci-dessus.

💡 Testez un clip avant un lot. Lancez le même portrait et les mêmes 10 secondes d’audio sur deux modèles, puis comparez la forme de la bouche sur les sons difficiles comme « p », « b » et « m ».

Essayez votre propre vidéo de synchronisation labiale

Choisissez un clip et testez-le avant de planifier un lot : un portrait, dix secondes d’audio propre, une seule offre. Passez-le dans Omni Human 1.5 ou Fabric 1.0 sur Picasso IA, comparez la forme des bouches avec l’audio, et gardez les réglages qui fonctionnent comme modèle de référence. Générez ensuite le portrait lui-même avec les modèles d’image de la plateforme, enregistrez ou synthétisez la voix, puis animez le tout. Ouvrez Picasso IA, importez votre première photo et voyez jusqu’où une seule image fixe et un court enregistrement de voix peuvent aller.

Partager cet article

Choisissez votre langue