API OmniHuman 1.5 : tarifs, synchronisation labiale et vidéos d’avatars

OmniHuman 1.5 transforme une photo de portrait et un fichier audio en vidéo parlante, facturée 0,16 $ par seconde sur fal.ai. Cet article détaille le coût réel de chaque clip, les limites de saisie, la qualité de la synchronisation labiale et la façon de lancer le modèle sur PicassoIA sans écrire de code.

API OmniHuman 1.5 : tarifs, synchronisation labiale et vidéos d’avatars
Cristian Da Conceicao
Fondateur de Picasso IA

Une seule photo de portrait et un enregistrement vocal de 30 secondes peuvent devenir une vidéo parlante pour 4,80 $. C’est le calcul derrière l’API OmniHuman 1.5, le modèle d’avatar piloté par l’audio de ByteDance, que fal.ai facture 0,16 $ par seconde de vidéo générée. Pas de caméra, pas de studio, pas d’acteur. Un visage, une voix et quelques minutes d’attente.

Cet article chiffre tout cela. Vous verrez combien coûtent des clips de différentes durées, quelles limites vont réellement bloquer votre travail (durée audio, résolution, formats de fichiers), comment la synchronisation labiale tient sur de vrais visages et dans quels cas une photo parlante vaut mieux qu’un tournage. Il contient aussi un pas à pas pour lancer OmniHuman 1.5 sur PicassoIA depuis le navigateur, ainsi qu’une courte liste d’alternatives à tester en parallèle.

💡 Réponse rapide : OmniHuman 1.5 prend une image d’une personne et un fichier audio, et renvoie une vidéo où le visage et la tête bougent au rythme de la parole. Sur fal.ai, il coûte 0,16 $ par seconde et accepte jusqu’à 60 secondes d’audio en 720p, ou 30 secondes en 1080p.

Ce que fait réellement OmniHuman 1.5

OmniHuman 1.5 est un modèle d’image vers vidéo conçu autour de l’audio. Au lieu d’inventer une scène à partir d’un prompt textuel, il part d’une personne que vous avez déjà et lui fait dire, chanter ou réagir à n’importe quel son que vous lui donnez.

Une photo, un fichier audio

Le flux de travail est presque trop simple. Importez une image qui montre une personne, un visage ou un personnage. Importez une piste audio. Le modèle anime le sujet afin que la bouche, les expressions et les mouvements de tête suivent le son. Un prompt textuel facultatif vous permet de diriger les gestes, la composition de la scène ou les mouvements de caméra.

Gros plan d’une femme souriante qui parle face à la caméra dans une cuisine lumineuse

Trois éléments le distinguent des anciens outils de photos parlantes :

  • Des mouvements au-delà des lèvres. Les expressions du visage, les gestes et les mouvements de tête répondent à l’émotion et au rythme de la parole, et pas seulement aux mots.
  • Des sujets variés. OmniHuman 1.5 sur PicassoIA accepte les vrais portraits, les plans en pied et les personnages illustrés.
  • Un audio multilingue. La page PicassoIA indique des voix off en anglais, espagnol, japonais, coréen, chinois et indonésien.

Ce qui a changé depuis OmniHuman 1

Le modèle original est toujours disponible, et l’écart entre les deux est assez faible pour que le prix entre dans la décision. La comparaison publiée par fal.ai les met côte à côte :

CaractéristiqueOmniHuman (original)OmniHuman 1.5
Prix sur fal.ai0,14 $ par seconde0,16 $ par seconde
RésolutionFixe, pas de choix720p ou 1080p
Limite audio30 secondes60 secondes en 720p, 30 secondes en 1080p
Mode turboNon disponibleDisponible
Entrées difficilesNécessite parfois plusieurs essaisPlus fiable dès le premier passage

« Entrées difficiles » désigne les visages partiellement cachés, l’audio bruité, un éclairage dur et les portraits de biais, c’est-à-dire les cas qui ruinaient autrefois une prise.

Sur PicassoIA, la différence est tout aussi visible. La page du modèle OmniHuman d’origine recommande un audio de 15 secondes ou moins, car la qualité commence à se dégrader au-delà. OmniHuman 1.5 accepte des clips de moins de 35 secondes et ajoute un prompt textuel, un mode rapide et un seed.

Tarifs de l’API OmniHuman 1.5 expliqués

La tarification est la partie la plus simple de ce modèle. Vous payez à la seconde de vidéo générée, et la sortie dure aussi longtemps que votre audio. Une voix off de 12 secondes donne une vidéo de 12 secondes et une facture de 1,92 $.

Vue de dessus d’un bureau avec un carnet de chiffres au crayon, une calculatrice et un chronomètre

Coût par seconde de vidéo

Voici ce que coûtent les durées de clips courantes au tarif fal.ai de 0,16 $ par seconde :

Durée du clipCoûtUsage typique
5 secondes0,80 $Extrait de test avant une génération complète
15 secondes2,40 $Publication sociale ou courte salutation
30 secondes4,80 $Présentation de produit, clip le plus long en 1080p
60 secondes9,60 $Vidéo explicative, clip le plus long en 720p

Le volume change vite la donne. Cent clips de 30 secondes font 480 $. Une mise à jour hebdomadaire de 20 secondes pendant un an (52 clips) coûte 166,40 $. Pour rendre cela concret, voici trois budgets mensuels réalistes :

ScénarioProductionSecondesCoût mensuel
Créateur solo8 clips de 20 secondes16025,60 $
Petite boutique en ligne30 clips de 15 secondes45072,00 $
Équipe de formation40 leçons de 45 secondes1 800288,00 $

La version 1.5 se paie plus cher que l’original, que fal.ai affiche à 0,14 $ par seconde. Sur un clip de 30 secondes, cela fait 4,20 $ contre 4,80 $, soit 60 cents de plus, ou 14 %. Sur 100 clips de ce type, l’écart atteint 60 $. Savoir si la limite audio plus longue et le choix de la résolution justifient cette différence dépend entièrement de votre volume.

💡 Vérifiez votre hébergeur. Les chiffres ci-dessus viennent de fal.ai. Les autres fournisseurs d’API fixent leurs propres tarifs : lisez donc la ligne de prix de votre fournisseur avant de budgéter une campagne.

Réduire la facture

Vous payez chaque seconde, donc les économies viennent du fait de gaspiller moins de secondes :

  1. Testez d’abord sur 5 secondes. Un extrait à 0,80 $ vous indique si le portrait fonctionne avant que vous ne dépensiez 9,60 $ pour une minute complète.
  2. Coupez les silences. Les blancs en début et en fin de fichier audio deviennent de la vidéo facturée.
  3. Brouillon rapide, finition soignée. Utilisez le 720p ou le mode turbo pour les brouillons, puis générez la prise validée en 1080p. Vérifiez si votre hébergeur facture le mode turbo différemment.
  4. Passez à des plans de coupe. Laissez l’avatar parler pendant 10 secondes, puis montrez le produit pendant 5 secondes. Vous ne payez que les secondes où il parle.
  5. Gardez le seed. Lorsqu’une prise fonctionne, réutilisez son seed sur PicassoIA pour la reproduire au lieu de payer une seconde fois pour un coup de chance.

Entrées, limites et paramètres

La plupart des générations ratées viennent des mêmes petites erreurs de saisie. Voici les limites qui comptent vraiment.

Exigences pour l’image et l’audio

Les deux endroits où vous pouvez lancer le modèle appliquent des règles légèrement différentes :

EntréeAPI fal.aiPicassoIA
Imageimage_url, JPEG ou PNG, accessible publiquementImportez une photo avec une personne, un visage ou un personnage
Audioaudio_url, MP3, WAV ou M4AMP3, WAV et formats similaires
Durée audio60 s en 720p, 30 s en 1080pMoins de 35 secondes, les fichiers plus longs échouent
Résolution720p ou 1080p, 1080p par défautNon proposée comme réglage
Entrées facultativesprompt, turbo_mode, mask_urlPrompt, mode rapide, seed

Vue par-dessus l’épaule d’un développeur qui tape du code sur un ordinateur portable dans un bureau en loft

Si vous appelez le modèle via fal.ai, le point de terminaison est fal-ai/bytedance/omnihuman/v1.5. Installez @fal-ai/client, définissez votre token API fal.ai comme variable d’environnement, et un appel ressemble à ceci :

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("fal-ai/bytedance/omnihuman/v1.5", {
  input: {
    image_url: "https://example.com/portrait.jpg",
    audio_url: "https://example.com/voiceover.mp3",
    resolution: "720p",
    turbo_mode: false,
    prompt: "Warm smile, small hand gestures, steady medium shot"
  },
  logs: true
});

console.log(result.data.video.url);

L’URL de la vidéo est renvoyée à data.video.url. fal.ai indique que le lien reste valide environ 24 heures : téléchargez donc le fichier et stockez-le immédiatement à un endroit permanent.

Résolution, mode turbo et prompts

  • Résolution. Le 1080p est la valeur par défaut et limite l’audio à 30 secondes. Passez au 720p lorsque vous avez besoin de jusqu’à 60 secondes ou d’une génération plus rapide.
  • Mode turbo. Sortie plus rapide en échange d’un peu de qualité. Parfait pour vérifier un portrait, pas pour la livraison finale. PicassoIA appelle cette même idée le mode rapide.
  • Prompt. Texte facultatif pour les expressions, le mouvement et la caméra. PicassoIA accepte les prompts en chinois, anglais, japonais, coréen, espagnol et indonésien.
  • Masque. Sur fal.ai, mask_url isole la personne qui doit parler lorsque plusieurs personnes figurent dans le cadre.

Écrivez des prompts sur le comportement, pas sur les lèvres. « Sourire calme, léger hochement de tête, mains posées sur le bureau » fonctionne mieux que « la bouche bouge avec les mots », car l’audio gère déjà la bouche.

La qualité de la synchronisation labiale en pratique

La synchronisation labiale est le point où les modèles d’avatars gagnent ou perdent, alors jugez-la comme le feront les spectateurs : sur un téléphone, à vitesse normale, le son activé.

Profil d’une comédienne qui parle devant un micro de studio équipé d’un filtre anti-pop

Là où il excelle

  • Une concordance émotionnelle. Sourires, mouvements des sourcils et inclinaisons de tête suivent le ton de la voix : une lecture enthousiaste paraît donc enthousiaste.
  • Des entrées imparfaites. fal.ai signale une meilleure gestion des visages partiellement cachés, de l’audio bruité, des éclairages difficiles et des portraits de biais que le modèle original.
  • Des clips à un seul locuteur. Un monologue de 10 à 30 secondes est le format idéal : une présentation, une annonce, une introduction de cours.
  • Des personnages illustrés. Mascottes et portraits stylisés s’animent aussi, ce qui aide les marques qui n’ont pas de porte-parole.

Là où il peine encore

  • Plafonds de durée. Moins de 35 secondes sur PicassoIA et 60 secondes au maximum sur fal.ai. Les scénarios plus longs doivent être découpés en scènes puis montés ensemble.
  • Temps d’attente. Les trois exemples publiés par PicassoIA avec le mode rapide ont pris 197, 280 et 370 secondes, soit environ 3 à 6 minutes chacun. Cela exclut le chat en direct ou toute utilisation en temps réel.
  • Nouveaux essais. Même avec une meilleure fiabilité, prévoyez une seconde tentative de temps en temps sur les portraits difficiles.
  • Entrées faibles. Un visage minuscule, flou ou très filtré donne un résultat faible. Une voix off plate et monotone donne une interprétation plate.

Usages concrets des vidéos d’avatars

Les cas d’usage les plus forts partagent un même trait : une personne doit apparaître à l’écran, mais la filmer est lent, coûteux ou impossible.

Présentations de produits et publicités

Un petit commerçant peut transformer une seule photo de fondateur en une présentation de produit de 20 secondes pour chaque nouvel article, enregistrée une fois en audio et actualisée à chaque modification du script.

Femme en tablier en jean photographiant une tasse en grès dans un atelier de poterie

Le format fonctionne bien pour les pages de destination, les publicités sur les réseaux sociaux et les fiches des places de marché, où un court visage humain renforce la confiance. Associez le clip parlant à des plans de coupe du produit : l’avatar n’a alors besoin de parler que pour l’accroche d’ouverture et l’offre de clôture.

Formation et éducation

Les créateurs de cours peuvent produire un présentateur pour chaque leçon sans enregistrer devant une caméra. Rédigez l’introduction de la leçon, enregistrez l’audio et laissez le portrait la délivrer. Gardez chaque clip sous la limite de durée et enchaînez plusieurs courts clips au fil de la leçon.

Enseignant en cardigan qui enregistre une leçon à un bureau de classe

Les équipes internes utilisent la même astuce pour les messages d’accueil et les mises à jour de politiques, où un visage constant compte davantage que la finition cinématographique.

Messages multilingues

Un seul portrait peut porter plusieurs voix. Enregistrez ou générez le même script en espagnol, japonais et anglais, puis lancez chaque fichier avec la même photo. Les lèvres suivent la langue au lieu de lutter contre elle.

Jeune femme avec des écouteurs tenant une tablette devant une carte du monde

Si vous avez déjà des images tournées et qu’elles ont seulement besoin d’être doublées, Video Translate s’en charge, tandis qu’OmniHuman 1.5 est le meilleur choix lorsque vous ne disposez que d’une photo fixe.

💡 Utilisez les visages réels de façon responsable. N’animez la photo d’une personne réelle que si vous avez sa permission, n’imitez jamais quelqu’un pour tromper les spectateurs, et signalez les vidéos synthétiques lorsqu’une plateforme le demande.

Comment utiliser OmniHuman 1.5 sur PicassoIA

Vous n’avez besoin ni de compte API ni de code. OmniHuman 1.5 sur PicassoIA fonctionne depuis le navigateur : deux imports, un prompt facultatif, un clic.

Mains d’une femme sur un ordinateur portable avec une fenêtre d’import montrant une miniature de portrait et un fichier audio

Préparer le portrait

Choisissez une photo où le visage est bien visible, uniformément éclairé et tourné vers la caméra ou légèrement de côté. Évitez les lunettes de soleil, les filtres lourds et les visages minuscules au milieu d’une foule.

Pas de photo adaptée ? Générez-en une avec Seedream 4.5, qui produit des images en 2K ou 4K au format 16:9 et dans d’autres formats. Décrivez une personne réaliste, une expression neutre et une lumière douce de fenêtre, puis utilisez le résultat comme avatar.

Ajouter votre audio

Enregistrez votre propre voix, ou générez une voix off avec Speech 2.8 HD ou ElevenLabs v3. Exportez-la en MP3 ou en WAV et gardez-la sous les 35 secondes, car les fichiers plus longs font échouer la génération. Retirez la musique de fond, car une parole nette donne la synchronisation la plus propre.

Lancer et vérifier le résultat

Importez l’image et l’audio, ajoutez un prompt si vous voulez guider le rendu, puis lancez la génération. Les exemples publiés en mode rapide sur PicassoIA se sont terminés en 3 à 6 minutes environ. Examinez ensuite le clip dans cet ordre :

  1. Les deux premières secondes, où les erreurs de synchronisation apparaissent en premier.
  2. Les dents et les coins de la bouche sur les voyelles longues.
  3. Les mains et les épaules, pour voir si le mouvement paraît naturel.

Voici le comportement de chaque paramètre :

ParamètreCe qu’il faitConseil
ImageLa personne qui parleDe face, nette, bien éclairée
AudioPilote la parole et la duréeMoins de 35 secondes, sans musique
PromptScène, mouvement et caméraDécrivez le comportement, pas les lèvres
Mode rapideSacrifie les détails fins à la vitesseActivé pour les brouillons, désactivé pour les rendus finaux
SeedRend une prise reproductibleSauvegardez le seed de toute prise retenue

Trois prompts à copier comme point de départ :

  • « Présentateur amical, épaules détendues, petits hochements de tête, plan américain stable. »
  • « Diction énergique, large sourire, gestes expressifs des mains, lumière de jour douce. »
  • « Ton calme et sérieux, mouvements minimes, lent travelling avant sur le visage. »

Autres modèles d’avatars à tester

Aucun modèle ne gagne à tous les coups, et chacun de ceux-ci est disponible sur la même plateforme : un test côte à côte ne vous coûte donc que quelques minutes.

Quatre collègues autour d’une table qui comparent des clips vidéo de portraits sur un écran mural

ModèleIdéal pourRemarques
OmniHuman 1.5Clips expressifs jusqu’à 35 secondesPrompt, mode rapide et seed
OmniHumanClips courtsMeilleure qualité à 15 secondes ou moins
Fabric 1.0Photos parlantes rapidesSortie en 480p ou 720p
Kling Avatar v2Visages, dessins animés et animauxModes Standard et Pro, prompt facultatif
P Video AvatarDu script à la vidéo sans audioPlus de 30 voix, 10 langues, jusqu’à 1080p
Lipsync 2 ProResynchroniser des images existantesPrend une vidéo MP4 et un fichier audio WAV

Choisissez selon votre point de départ. Si vous partez d’une photo et d’un enregistrement, commencez par OmniHuman 1.5 et comparez-le avec Fabric 1.0 ou Kling Avatar v2. Si vous n’avez qu’un script écrit et pas de voix, P Video Avatar peut le prononcer à votre place. Si vous avez déjà tourné la vidéo et n’avez besoin que de nouvelles lèvres, Lipsync 2 Pro réécrit le mouvement de la bouche pour le faire correspondre à une nouvelle piste audio.

Créez votre première photo parlante dès aujourd’hui

Lire sur les tarifs ne vous mènera que jusqu’à un certain point. Le moyen le plus rapide de juger OmniHuman 1.5 est de lui donner votre propre portrait et une note vocale de 10 secondes, puis de regarder le résultat à vitesse normale.

Générez un visage avec Seedream 4.5, enregistrez ou synthétisez une courte réplique, puis lancez les deux avec OmniHuman 1.5. Essayez la même photo avec trois voix différentes. Remplacez le prompt « calme et stable » par « énergique, large sourire » et comparez les prises.

Chaque modèle mentionné ici se trouve au même endroit, sur picassoia.com/en/all-models. Ouvrez la page, choisissez deux modèles d’avatars et réalisez votre première vidéo parlante avant que votre café ne refroidisse.

Partager cet article

Choisissez votre langue