API de lip sync : gratuit, HeyGen, Kling et Hedra comparés

Comparatif de quatre façons d’ajouter du lip sync à vos vidéos : la voie gratuite dans le navigateur, HeyGen pour le doublage, Kling pour les clips courts et Hedra pour les personnages parlants. Découvrez les vraies limites, les prix à la seconde et un tutoriel pas à pas pour Kling.

API de lip sync : gratuit, HeyGen, Kling et Hedra comparés
Cristian Da Conceicao
Fondateur de Picasso IA

Choisir une API de lip sync paraît simple jusqu’à ce que vous ouvriez trois pages tarifaires. HeyGen facture à la seconde de sortie, Kling accepte des clips de 2 à 10 secondes, et Hedra tarifie selon la résolution. Entre-temps, le mot gratuit apparaît partout et ne signifie pas la même chose à chaque fois. Ce comparatif met côte à côte les vraies limites, les vrais coûts et les vrais compromis, pour que vous adaptiez l’outil à la tâche plutôt qu’au logo.

Tous les chiffres ci-dessous proviennent d’une page éditeur ou d’une fiche d’hébergement, vérifiés en octobre 2026. Lorsque les sources divergeaient, nous le signalons au lieu de désigner un gagnant.

💡 Réponse rapide : Hedra est le choix pour des personnages parlants à partir d’une photo fixe, Kling est l’option économique pour les courts clips à texte fixe, et HeyGen est conçu pour doubler des images réelles dans d’autres langues. Si vous voulez seulement tester des voix et des clips sans écrire de code, la voie du navigateur est gratuite.

Ce que fait une API de lip sync

Une API de lip sync prend un visage et une voix, puis renvoie une vidéo où la bouche correspond au son. Cette phrase cache deux produits très différents, et les confondre est la cause la plus fréquente d’un comparatif raté.

Un ingénieur du son observe une comédienne de doublage en cabine d’enregistrement

Vidéo en entrée, vidéo en sortie

Vous fournissez des images d’un véritable locuteur plus une nouvelle piste audio, et le modèle réécrit la zone de la bouche image par image. C’est le doublage. Kling Lip Sync, le moteur HeyGen Lipsync Precision et Lipsync 2 Pro fonctionnent tous ainsi. La performance d’origine, l’éclairage et l’arrière-plan restent en place. Seules les lèvres changent.

Photo en entrée, vidéo en sortie

Vous fournissez un seul portrait et un fichier audio, et le modèle invente toute la performance : lèvres, mouvements de tête, clignements, expressions. Le Character-3 de Hedra, Omni Human 1.5 et Fabric 1.0 relèvent de cette catégorie. Il n’existe aucune séquence source à préserver, ce qui fait à la fois l’attrait et le risque.

Une troisième catégorie, plus discrète, se passe de l’enregistrement : texte en entrée, parole et vidéo en sortie. Le mode texte de Kling et Seedance 2.5 Lite génèrent tous deux la voix eux-mêmes. Cela évite de passer par un outil de synthèse vocale, mais vous gardez moins de contrôle sur la diction, le rythme et l’accent.

💡 Prévoyez l’attente. Toute API de lip sync sérieuse est asynchrone. Vous soumettez une tâche, interrogez le serveur ou attendez un webhook, puis téléchargez le fichier. Une fiche Kling hébergée annonce environ 12 minutes de traitement par requête, donc un bouton qui bloque la page jusqu’à ce que la vidéo soit prête frustrera vos utilisateurs.

La voie gratuite, en toute franchise

« Gratuit » recouvre trois réalités différentes sur ce marché, et une seule correspond à une véritable API.

  • Gratuit à essayer dans un navigateur. PicassoIA référence 12 modèles de lip sync, dont Kling Lip Sync, Lipsync Speed, Lipsync Precision et Video Translate de HeyGen, Lipsync 2 et Lipsync 2 Pro de Sync, Omni Human de ByteDance, et Fabric 1.0 de VEED. Beaucoup de leurs pages les décrivent comme gratuits à essayer en ligne, sans code.
  • Appels API gratuits. La page API de PicassoIA indique que les prédictions sont actuellement gratuites et ne consomment aucun crédit, mais elle exige un forfait Infinite. Sans lui, les requêtes renvoient une erreur 403 plan_required.
  • Essais chez les éditeurs. D’autres fournisseurs proposent leurs propres quotas gratuits. Ils changent souvent, donc consultez la page tarifaire en direct avant de bâtir quoi que ce soit dessus.

Le bureau d’un développeur au crépuscule, avec deux écrans flous et une tasse de café

Ce que l’API PicassoIA expose

L’API se trouve à https://api.picassoia.com/v1 et utilise un token Bearer. Elle suit le schéma de prédiction habituel : POST /v1/models/{owner}/{name}/predictions crée une tâche, et GET /v1/predictions/{id} renvoie son statut. Un compte peut lancer 5 prédictions simultanées, partagées avec les connexions MCP éventuelles.

Quatre modèles sont disponibles via cette API : picassoia/picassoia-image, picassoia/picassoia-image-editor-pro, picassoia/picassoia-video et picassoia/seedance-2.5-lite. Aucun d’entre eux n’est un modèle de lip sync dédié. Le plus proche est Seedance 2.5 Lite, qui génère une vidéo à partir d’un texte ou d’une image, avec un audio synchronisé natif. C’est utile pour générer une scène où quelqu’un parle depuis zéro. En revanche, il ne resynchronisera pas la bouche d’une séquence déjà tournée.

Où s’arrête la gratuité

Les 12 modèles de lip sync dédiés fonctionnent dans le navigateur, pas via cette API. La voie gratuite convient donc pour tester des voix, doubler quelques clips et choisir un modèle. Elle ne convient pas à une application qui doit synchroniser les lèvres à la demande pour ses propres utilisateurs. Pour cela, il vous faut HeyGen, Hedra ou un point d’accès Kling hébergé.

💡 Prototypez d’abord. Fixez la voix, la durée du clip et le modèle dans le navigateur avant d’écrire la moindre ligne de code d’intégration. Changer de moteur plus tard oblige à tout retester.

HeyGen : conçu pour le doublage

HeyGen traite le lip sync comme un problème de doublage. Vous fournissez une vidéo et un audio de remplacement, et il réanime la bouche du locuteur pour qu’elle corresponde. PicassoIA propose trois moteurs HeyGen : Lipsync Speed, Lipsync Precision et Video Translate, qui gère le doublage dans plus de 150 langues.

Trois collègues examinent une présentation doublée sur un grand écran mural

Speed ou Precision

La description que donne HeyGen est simple. Speed est plus rapide et offre une qualité de lip sync standard, ce qui convient aux visages qui bougent peu et aux brouillons rapides. Precision est plus lent et tient mieux sur les profils, les bouches partiellement cachées et les fichiers de livraison finaux.

Les deux moteurs de PicassoIA partagent les mêmes trois options :

  • Supprimer la piste musicale de la vidéo source avant le traitement, pour que la nouvelle voix se place proprement.
  • Durée dynamique, activée par défaut, permet à la sortie de s’allonger ou de se raccourcir à la longueur de la nouvelle piste audio.
  • Clarté de la parole, désactivée par défaut, rend la voix plus nette dans le fichier final.

Le coût

L’API de HeyGen fonctionne au paiement à l’usage. Vous rechargez un solde à partir de 5 $, et chaque tâche le débite à la seconde de vidéo produite. Precision coûte environ le double de Speed.

Nous omettons volontairement les tarifs exacts. Les chiffres publiés diffèrent entre les pages d’aide de HeyGen et les synthèses de tiers, et nous n’avons pu confirmer aucun tableau à partir des pages officielles. Consultez la grille tarifaire en direct avant de budgétiser.

Quand HeyGen n’est pas le bon choix. Si votre source est une photo unique, ou si vous voulez un personnage inventé plutôt qu’un locuteur réel, les moteurs de doublage ne conviennent pas. Ils attendent une personne déjà à l’image et conservent intacte sa performance. Pour les locuteurs inventés, regardez les outils centrés sur la photo plus bas.

Kling : courts clips, coûts réduits

Le lip sync de Kling est conçu pour les courts clips, et cela détermine tout le reste. Si votre vidéo est une explication de 90 secondes, vous devrez la découper en morceaux. Si c’est une publicité produit de 6 secondes avec une phrase fixe, c’est presque idéal.

Un créateur filme un court clip parlé sur un balcon ensoleillé, avec un téléphone sur stabilisateur

Les limites strictes

EntréeLimite
Format vidéoMP4 ou MOV
Durée vidéo2 à 10 secondes
Taille vidéoMoins de 100 Mo
Résolution720p à 1080p (720 à 1920 px sur le plus grand côté)
Format audioMP3, WAV, M4A ou AAC, moins de 5 Mo

La fiche fal.ai du même modèle accepte aussi l’OGG et autorise un audio allant jusqu’à 60 secondes. Vérifiez toujours l’hébergeur que vous appelez, car les limites diffèrent légèrement d’une plateforme à l’autre.

Le coût

Via fal.ai, le lip sync de Kling est facturé 0,014 $ par bloc de 5 secondes de vidéo source, arrondi au supérieur. Un clip de 3 secondes est facturé comme 5 secondes (0,014 $). Un clip de 7 secondes est facturé comme 10 secondes (0,028 $). Une vidéo de 60 secondes découpée en six clips de 10 secondes revient à environ 17 centimes au total.

C’est un chiffre très bas, et il s’accompagne d’un travail à faire : vous découpez la vidéo, lancez chaque clip, puis assemblez les résultats en veillant à garder un éclairage et un cadrage cohérents d’un morceau à l’autre. Les prix chez d’autres hébergeurs, et sur la plateforme de Kling elle-même, diffèrent.

Kling propose aussi un mode texte : vous tapez un script, choisissez une voix intégrée, et le modèle prononce la phrase et synchronise la bouche en une seule passe. Les voix intégrées ne sont disponibles qu’en anglais et en chinois, donc pour l’espagnol, le français ou le japonais, vous apportez votre propre audio.

Hedra : la photo d’abord, la performance ensuite

Le Character-3 de Hedra part d’une image fixe et d’un fichier audio, puis construit autour d’eux une performance parlée, avec mouvements de tête et expressions. Sa propre page tarifaire indique 2,5 centimes par seconde en 540p, 5 centimes en 720p et 6,25 centimes en 1080p, avec des clips pouvant atteindre 10 minutes. L’accès API passe par la Hedra Developer Platform. Comme le modèle est piloté par l’audio, toute source vocale convient : un enregistrement en studio, une voix clonée ou une piste de synthèse vocale.

Une main tient une photo de portrait imprimée face au sujet réel, près d’une fenêtre

Une minute de vidéo finale coûte donc environ 1,50 $ en 540p, 3,00 $ en 720p et 3,75 $ en 1080p. C’est bien plus cher qu’une série de clips Kling, mais vous payez une performance complète à partir d’une seule photo, sans séquence source ni assemblage.

Hedra n’est pas disponible sur PicassoIA, donc il n’existe pas de version navigateur à essayer ici. Voici les options image vers vidéo les plus proches qui le sont :

  • Omni Human 1.5 accepte un portrait et un audio pouvant aller jusqu’à 35 secondes, prend un prompt textuel facultatif pour la scène et la direction de caméra, et propose un mode rapide.
  • Fabric 1.0 transforme une photo et un audio en vidéo parlée en 480p ou 720p.
  • P Video Avatar crée des vidéos d’avatars parlants.
  • Omni Human est le modèle ByteDance de base pour animer une photo en vidéo parlée.

Comparatif côte à côte

Les prix ci-dessous datent d’octobre 2026 et évoluent souvent, donc considérez-les comme un instantané.

OutilEntréeLimite de clipBase de coûtMode d’appelIdéal pour
HeyGen (Speed, Precision)Vidéo plus nouvelle piste audioSelon le forfaitSolde prépayé, facturé à la secondeAPI HeyGenDoubler des images réelles
Kling Lip SyncVidéo plus audio ou texte2 à 10 s par clip0,014 $ par bloc de 5 s sur fal.aiAPI hébergées comme fal.aiPublicités courtes et clips sociaux
Hedra Character-3Photo plus audioJusqu’à 10 minutes2,5 à 6,25 centimes par secondeHedra Developer PlatformPersonnages à partir d’une image fixe
Modèles de lip sync PicassoIAVidéo ou photo plus audioVariable selon le modèleGratuit à essayer dans le navigateurNavigateur (l’API compte 4 modèles, aucun dédié au lip sync)Tests et doublages ponctuels

Un bureau vu d’en haut, avec un ordinateur portable, un casque et un bloc-notes de tableaux comparatifs

Une minute, trois factures

Prenons une minute de vidéo finale. Hedra en 720p coûte environ 3,00 $. Kling via fal.ai coûte environ 17 centimes, plus le travail de découpe et d’assemblage de six clips. HeyGen dépend du moteur choisi et de la grille du moment. Dans le navigateur de PicassoIA, l’essayer ne coûte rien.

Le prix n’est pas la qualité. Un essai bon marché qui nécessite trois reprises parce que la bouche était à moitié cachée n’est pas bon marché, tandis qu’un essai coûteux qui fonctionne du premier coup l’est souvent.

Quel outil pour votre besoin

  • Doubler une vidéo produit en cinq langues : HeyGen, avec Precision pour le montage final.
  • Publicités verticales courtes avec un texte fixe : Kling.
  • Un porte-parole créé à partir d’un seul portrait : Hedra, ou Omni Human 1.5 et Fabric 1.0 dans le navigateur.
  • Émotion et mouvements de tête : React 1 propose six émotions (joie, tristesse, colère, dégoût, surprise, neutre) et trois zones de retouche : les lèvres, le visage ou la tête.
  • Un audio qui ne correspond pas à la durée de la vidéo : Lipsync 2 Pro propose cinq modes de synchronisation (boucle, rebond, coupure, silence, remappage) et la détection du locuteur actif pour les plans à plusieurs visages.

Ce qu’il faut tester avant de vous engager

Faites passer le même clip de 8 secondes dans chaque candidat et notez cinq points :

  • Consonnes dures. Les lèvres se referment-elles vraiment sur p, b et m ?
  • Dents et langue. Les modèles faibles brouillent l’intérieur de la bouche.
  • Identité. Le visage ressemble-t-il toujours à la même personne sur la dernière image ?
  • Dérive. La synchronisation tient-elle à la seconde 8 aussi bien qu’à la seconde 1 ?
  • Délai. Combien de temps entre l’envoi et le téléchargement, et cela change-t-il aux heures de pointe ?

Multipliez ensuite le prix du vainqueur par vos minutes mensuelles réelles. C’est ce chiffre, et non le tarif affiché, que vous paierez.

Comment utiliser Kling Lip Sync

Le moyen le plus rapide de savoir si le moteur de Kling convient à vos images est de tester un clip sur la page Kling Lip Sync de PicassoIA.

Les mains d’un monteur sur un ordinateur portable, avec une timeline vidéo et une image de visage figée

Pas à pas

  1. Ouvrez la page du modèle et connectez-vous à votre compte PicassoIA.
  2. Ajoutez votre vidéo par URL : MP4 ou MOV, 2 à 10 secondes, 720p à 1080p, moins de 100 Mo. Si le clip vient de Kling lui-même, vous pouvez coller son video_id à la place.
  3. Choisissez votre audio. Importez un fichier MP3, WAV, M4A ou AAC de moins de 5 Mo, ou ignorez cette étape et tapez un script dans le champ texte.
  4. Choisissez une voix si vous avez tapé un script. Réglez voice_id (la valeur par défaut est en_AOT) et voice_speed (la valeur par défaut est 1).
  5. Lancez le modèle et attendez le résultat.
  6. Vérifiez les sons durs. Parcourez les sons p, b et m, où les lèvres se ferment, et téléchargez le fichier propre une fois qu’ils sont bien rendus.

Réglages à connaître

RéglageRôlePar défaut
video_urlClip source, 2 à 10 secondesAucun
audio_filePiste vocale à synchroniserAucun
textScript prononcé par une voix intégrée, utilisé à la place de l’audioAucun
voice_idChoisit l’une des dizaines de voix anglaises et chinoisesen_AOT
voice_speedDébit de parole pour les scripts tapés1

Pour toute autre langue, enregistrez ou générez d’abord l’audio, puis importez-le. MiniMax Speech 2.8 HD et ElevenLabs v3 produisent tous deux une piste vocale que vous pouvez utiliser directement, et MiniMax Voice Cloning conserve la même voix sur une série.

Trois erreurs à éviter

Gros plan d’un homme qui parle, avec un micro-cravate fixé au col

  1. Un clip trop long. Le modèle attend 10 secondes ou moins. Recadrez d’abord, puis découpez une vidéo plus longue en morceaux qui se terminent chacun sur une pause naturelle.
  2. Une bouche cachée. Les mains, les micros et les angles de profil devant les lèvres sont les causes habituelles d’une synchronisation faible. Choisissez des images où la bouche est bien visible.
  3. Un audio sale. La musique de fond ou le bruit de la pièce dans le fichier vocal donnent au modèle un signal confus. Utilisez une piste vocale propre, et ajoutez la musique ensuite.

Créez votre premier clip synchronisé

Lire trois pages tarifaires ne vous dira pas quel moteur convient à votre visage, à votre voix et à votre script. Un test de cinq secondes, lui, le fera. Enregistrez dix secondes de voix propre, prenez un court clip, et passez-le dans Kling Lip Sync. Faites ensuite passer les mêmes fichiers dans Lipsync 2 Pro et React 1, et comparez les bouches côte à côte.

Deux créateurs dans un studio loft examinent un clip terminé sur un grand écran

PicassoIA réunit les 12 modèles de lip sync au même endroit, afin que vous les compariez sur vos propres images avant de vous engager dans un contrat d’API. Choisissez un modèle, importez un clip et voyez ce qui correspond. Parcourez l’ensemble de la gamme sur picassoia.com/en/all-models et commencez à expérimenter dès aujourd’hui.

Partager cet article

Choisissez votre langue