API OmniHuman 1.5 : tarifs, synchronisation labiale et vidéos d’avatars
OmniHuman 1.5 transforme une photo de portrait et un fichier audio en vidéo parlante, facturée 0,16 $ par seconde sur fal.ai. Cet article détaille le coût réel de chaque clip, les limites de saisie, la qualité de la synchronisation labiale et la façon de lancer le modèle sur PicassoIA sans écrire de code.
Une seule photo de portrait et un enregistrement vocal de 30 secondes peuvent devenir une vidéo parlante pour 4,80 $. C’est le calcul derrière l’API OmniHuman 1.5, le modèle d’avatar piloté par l’audio de ByteDance, que fal.ai facture 0,16 $ par seconde de vidéo générée. Pas de caméra, pas de studio, pas d’acteur. Un visage, une voix et quelques minutes d’attente.
Cet article chiffre tout cela. Vous verrez combien coûtent des clips de différentes durées, quelles limites vont réellement bloquer votre travail (durée audio, résolution, formats de fichiers), comment la synchronisation labiale tient sur de vrais visages et dans quels cas une photo parlante vaut mieux qu’un tournage. Il contient aussi un pas à pas pour lancer OmniHuman 1.5 sur PicassoIA depuis le navigateur, ainsi qu’une courte liste d’alternatives à tester en parallèle.
💡 Réponse rapide : OmniHuman 1.5 prend une image d’une personne et un fichier audio, et renvoie une vidéo où le visage et la tête bougent au rythme de la parole. Sur fal.ai, il coûte 0,16 $ par seconde et accepte jusqu’à 60 secondes d’audio en 720p, ou 30 secondes en 1080p.
Ce que fait réellement OmniHuman 1.5
OmniHuman 1.5 est un modèle d’image vers vidéo conçu autour de l’audio. Au lieu d’inventer une scène à partir d’un prompt textuel, il part d’une personne que vous avez déjà et lui fait dire, chanter ou réagir à n’importe quel son que vous lui donnez.
Une photo, un fichier audio
Le flux de travail est presque trop simple. Importez une image qui montre une personne, un visage ou un personnage. Importez une piste audio. Le modèle anime le sujet afin que la bouche, les expressions et les mouvements de tête suivent le son. Un prompt textuel facultatif vous permet de diriger les gestes, la composition de la scène ou les mouvements de caméra.
Trois éléments le distinguent des anciens outils de photos parlantes :
Des mouvements au-delà des lèvres. Les expressions du visage, les gestes et les mouvements de tête répondent à l’émotion et au rythme de la parole, et pas seulement aux mots.
Des sujets variés.OmniHuman 1.5 sur PicassoIA accepte les vrais portraits, les plans en pied et les personnages illustrés.
Un audio multilingue. La page PicassoIA indique des voix off en anglais, espagnol, japonais, coréen, chinois et indonésien.
Ce qui a changé depuis OmniHuman 1
Le modèle original est toujours disponible, et l’écart entre les deux est assez faible pour que le prix entre dans la décision. La comparaison publiée par fal.ai les met côte à côte :
Caractéristique
OmniHuman (original)
OmniHuman 1.5
Prix sur fal.ai
0,14 $ par seconde
0,16 $ par seconde
Résolution
Fixe, pas de choix
720p ou 1080p
Limite audio
30 secondes
60 secondes en 720p, 30 secondes en 1080p
Mode turbo
Non disponible
Disponible
Entrées difficiles
Nécessite parfois plusieurs essais
Plus fiable dès le premier passage
« Entrées difficiles » désigne les visages partiellement cachés, l’audio bruité, un éclairage dur et les portraits de biais, c’est-à-dire les cas qui ruinaient autrefois une prise.
Sur PicassoIA, la différence est tout aussi visible. La page du modèle OmniHuman d’origine recommande un audio de 15 secondes ou moins, car la qualité commence à se dégrader au-delà. OmniHuman 1.5 accepte des clips de moins de 35 secondes et ajoute un prompt textuel, un mode rapide et un seed.
Tarifs de l’API OmniHuman 1.5 expliqués
La tarification est la partie la plus simple de ce modèle. Vous payez à la seconde de vidéo générée, et la sortie dure aussi longtemps que votre audio. Une voix off de 12 secondes donne une vidéo de 12 secondes et une facture de 1,92 $.
Coût par seconde de vidéo
Voici ce que coûtent les durées de clips courantes au tarif fal.ai de 0,16 $ par seconde :
Durée du clip
Coût
Usage typique
5 secondes
0,80 $
Extrait de test avant une génération complète
15 secondes
2,40 $
Publication sociale ou courte salutation
30 secondes
4,80 $
Présentation de produit, clip le plus long en 1080p
60 secondes
9,60 $
Vidéo explicative, clip le plus long en 720p
Le volume change vite la donne. Cent clips de 30 secondes font 480 $. Une mise à jour hebdomadaire de 20 secondes pendant un an (52 clips) coûte 166,40 $. Pour rendre cela concret, voici trois budgets mensuels réalistes :
Scénario
Production
Secondes
Coût mensuel
Créateur solo
8 clips de 20 secondes
160
25,60 $
Petite boutique en ligne
30 clips de 15 secondes
450
72,00 $
Équipe de formation
40 leçons de 45 secondes
1 800
288,00 $
La version 1.5 se paie plus cher que l’original, que fal.ai affiche à 0,14 $ par seconde. Sur un clip de 30 secondes, cela fait 4,20 $ contre 4,80 $, soit 60 cents de plus, ou 14 %. Sur 100 clips de ce type, l’écart atteint 60 $. Savoir si la limite audio plus longue et le choix de la résolution justifient cette différence dépend entièrement de votre volume.
💡 Vérifiez votre hébergeur. Les chiffres ci-dessus viennent de fal.ai. Les autres fournisseurs d’API fixent leurs propres tarifs : lisez donc la ligne de prix de votre fournisseur avant de budgéter une campagne.
Réduire la facture
Vous payez chaque seconde, donc les économies viennent du fait de gaspiller moins de secondes :
Testez d’abord sur 5 secondes. Un extrait à 0,80 $ vous indique si le portrait fonctionne avant que vous ne dépensiez 9,60 $ pour une minute complète.
Coupez les silences. Les blancs en début et en fin de fichier audio deviennent de la vidéo facturée.
Brouillon rapide, finition soignée. Utilisez le 720p ou le mode turbo pour les brouillons, puis générez la prise validée en 1080p. Vérifiez si votre hébergeur facture le mode turbo différemment.
Passez à des plans de coupe. Laissez l’avatar parler pendant 10 secondes, puis montrez le produit pendant 5 secondes. Vous ne payez que les secondes où il parle.
Gardez le seed. Lorsqu’une prise fonctionne, réutilisez son seed sur PicassoIA pour la reproduire au lieu de payer une seconde fois pour un coup de chance.
Entrées, limites et paramètres
La plupart des générations ratées viennent des mêmes petites erreurs de saisie. Voici les limites qui comptent vraiment.
Exigences pour l’image et l’audio
Les deux endroits où vous pouvez lancer le modèle appliquent des règles légèrement différentes :
Entrée
API fal.ai
PicassoIA
Image
image_url, JPEG ou PNG, accessible publiquement
Importez une photo avec une personne, un visage ou un personnage
Audio
audio_url, MP3, WAV ou M4A
MP3, WAV et formats similaires
Durée audio
60 s en 720p, 30 s en 1080p
Moins de 35 secondes, les fichiers plus longs échouent
Résolution
720p ou 1080p, 1080p par défaut
Non proposée comme réglage
Entrées facultatives
prompt, turbo_mode, mask_url
Prompt, mode rapide, seed
Si vous appelez le modèle via fal.ai, le point de terminaison est fal-ai/bytedance/omnihuman/v1.5. Installez @fal-ai/client, définissez votre token API fal.ai comme variable d’environnement, et un appel ressemble à ceci :
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("fal-ai/bytedance/omnihuman/v1.5", {
input: {
image_url: "https://example.com/portrait.jpg",
audio_url: "https://example.com/voiceover.mp3",
resolution: "720p",
turbo_mode: false,
prompt: "Warm smile, small hand gestures, steady medium shot"
},
logs: true
});
console.log(result.data.video.url);
L’URL de la vidéo est renvoyée à data.video.url. fal.ai indique que le lien reste valide environ 24 heures : téléchargez donc le fichier et stockez-le immédiatement à un endroit permanent.
Résolution, mode turbo et prompts
Résolution. Le 1080p est la valeur par défaut et limite l’audio à 30 secondes. Passez au 720p lorsque vous avez besoin de jusqu’à 60 secondes ou d’une génération plus rapide.
Mode turbo. Sortie plus rapide en échange d’un peu de qualité. Parfait pour vérifier un portrait, pas pour la livraison finale. PicassoIA appelle cette même idée le mode rapide.
Prompt. Texte facultatif pour les expressions, le mouvement et la caméra. PicassoIA accepte les prompts en chinois, anglais, japonais, coréen, espagnol et indonésien.
Masque. Sur fal.ai, mask_url isole la personne qui doit parler lorsque plusieurs personnes figurent dans le cadre.
Écrivez des prompts sur le comportement, pas sur les lèvres. « Sourire calme, léger hochement de tête, mains posées sur le bureau » fonctionne mieux que « la bouche bouge avec les mots », car l’audio gère déjà la bouche.
La qualité de la synchronisation labiale en pratique
La synchronisation labiale est le point où les modèles d’avatars gagnent ou perdent, alors jugez-la comme le feront les spectateurs : sur un téléphone, à vitesse normale, le son activé.
Là où il excelle
Une concordance émotionnelle. Sourires, mouvements des sourcils et inclinaisons de tête suivent le ton de la voix : une lecture enthousiaste paraît donc enthousiaste.
Des entrées imparfaites. fal.ai signale une meilleure gestion des visages partiellement cachés, de l’audio bruité, des éclairages difficiles et des portraits de biais que le modèle original.
Des clips à un seul locuteur. Un monologue de 10 à 30 secondes est le format idéal : une présentation, une annonce, une introduction de cours.
Des personnages illustrés. Mascottes et portraits stylisés s’animent aussi, ce qui aide les marques qui n’ont pas de porte-parole.
Là où il peine encore
Plafonds de durée. Moins de 35 secondes sur PicassoIA et 60 secondes au maximum sur fal.ai. Les scénarios plus longs doivent être découpés en scènes puis montés ensemble.
Temps d’attente. Les trois exemples publiés par PicassoIA avec le mode rapide ont pris 197, 280 et 370 secondes, soit environ 3 à 6 minutes chacun. Cela exclut le chat en direct ou toute utilisation en temps réel.
Nouveaux essais. Même avec une meilleure fiabilité, prévoyez une seconde tentative de temps en temps sur les portraits difficiles.
Entrées faibles. Un visage minuscule, flou ou très filtré donne un résultat faible. Une voix off plate et monotone donne une interprétation plate.
Usages concrets des vidéos d’avatars
Les cas d’usage les plus forts partagent un même trait : une personne doit apparaître à l’écran, mais la filmer est lent, coûteux ou impossible.
Présentations de produits et publicités
Un petit commerçant peut transformer une seule photo de fondateur en une présentation de produit de 20 secondes pour chaque nouvel article, enregistrée une fois en audio et actualisée à chaque modification du script.
Le format fonctionne bien pour les pages de destination, les publicités sur les réseaux sociaux et les fiches des places de marché, où un court visage humain renforce la confiance. Associez le clip parlant à des plans de coupe du produit : l’avatar n’a alors besoin de parler que pour l’accroche d’ouverture et l’offre de clôture.
Formation et éducation
Les créateurs de cours peuvent produire un présentateur pour chaque leçon sans enregistrer devant une caméra. Rédigez l’introduction de la leçon, enregistrez l’audio et laissez le portrait la délivrer. Gardez chaque clip sous la limite de durée et enchaînez plusieurs courts clips au fil de la leçon.
Les équipes internes utilisent la même astuce pour les messages d’accueil et les mises à jour de politiques, où un visage constant compte davantage que la finition cinématographique.
Messages multilingues
Un seul portrait peut porter plusieurs voix. Enregistrez ou générez le même script en espagnol, japonais et anglais, puis lancez chaque fichier avec la même photo. Les lèvres suivent la langue au lieu de lutter contre elle.
Si vous avez déjà des images tournées et qu’elles ont seulement besoin d’être doublées, Video Translate s’en charge, tandis qu’OmniHuman 1.5 est le meilleur choix lorsque vous ne disposez que d’une photo fixe.
💡 Utilisez les visages réels de façon responsable. N’animez la photo d’une personne réelle que si vous avez sa permission, n’imitez jamais quelqu’un pour tromper les spectateurs, et signalez les vidéos synthétiques lorsqu’une plateforme le demande.
Comment utiliser OmniHuman 1.5 sur PicassoIA
Vous n’avez besoin ni de compte API ni de code. OmniHuman 1.5 sur PicassoIA fonctionne depuis le navigateur : deux imports, un prompt facultatif, un clic.
Préparer le portrait
Choisissez une photo où le visage est bien visible, uniformément éclairé et tourné vers la caméra ou légèrement de côté. Évitez les lunettes de soleil, les filtres lourds et les visages minuscules au milieu d’une foule.
Pas de photo adaptée ? Générez-en une avec Seedream 4.5, qui produit des images en 2K ou 4K au format 16:9 et dans d’autres formats. Décrivez une personne réaliste, une expression neutre et une lumière douce de fenêtre, puis utilisez le résultat comme avatar.
Ajouter votre audio
Enregistrez votre propre voix, ou générez une voix off avec Speech 2.8 HD ou ElevenLabs v3. Exportez-la en MP3 ou en WAV et gardez-la sous les 35 secondes, car les fichiers plus longs font échouer la génération. Retirez la musique de fond, car une parole nette donne la synchronisation la plus propre.
Lancer et vérifier le résultat
Importez l’image et l’audio, ajoutez un prompt si vous voulez guider le rendu, puis lancez la génération. Les exemples publiés en mode rapide sur PicassoIA se sont terminés en 3 à 6 minutes environ. Examinez ensuite le clip dans cet ordre :
Les deux premières secondes, où les erreurs de synchronisation apparaissent en premier.
Les dents et les coins de la bouche sur les voyelles longues.
Les mains et les épaules, pour voir si le mouvement paraît naturel.
Voici le comportement de chaque paramètre :
Paramètre
Ce qu’il fait
Conseil
Image
La personne qui parle
De face, nette, bien éclairée
Audio
Pilote la parole et la durée
Moins de 35 secondes, sans musique
Prompt
Scène, mouvement et caméra
Décrivez le comportement, pas les lèvres
Mode rapide
Sacrifie les détails fins à la vitesse
Activé pour les brouillons, désactivé pour les rendus finaux
Seed
Rend une prise reproductible
Sauvegardez le seed de toute prise retenue
Trois prompts à copier comme point de départ :
« Présentateur amical, épaules détendues, petits hochements de tête, plan américain stable. »
« Diction énergique, large sourire, gestes expressifs des mains, lumière de jour douce. »
« Ton calme et sérieux, mouvements minimes, lent travelling avant sur le visage. »
Autres modèles d’avatars à tester
Aucun modèle ne gagne à tous les coups, et chacun de ceux-ci est disponible sur la même plateforme : un test côte à côte ne vous coûte donc que quelques minutes.
Choisissez selon votre point de départ. Si vous partez d’une photo et d’un enregistrement, commencez par OmniHuman 1.5 et comparez-le avec Fabric 1.0 ou Kling Avatar v2. Si vous n’avez qu’un script écrit et pas de voix, P Video Avatar peut le prononcer à votre place. Si vous avez déjà tourné la vidéo et n’avez besoin que de nouvelles lèvres, Lipsync 2 Pro réécrit le mouvement de la bouche pour le faire correspondre à une nouvelle piste audio.
Créez votre première photo parlante dès aujourd’hui
Lire sur les tarifs ne vous mènera que jusqu’à un certain point. Le moyen le plus rapide de juger OmniHuman 1.5 est de lui donner votre propre portrait et une note vocale de 10 secondes, puis de regarder le résultat à vitesse normale.
Générez un visage avec Seedream 4.5, enregistrez ou synthétisez une courte réplique, puis lancez les deux avec OmniHuman 1.5. Essayez la même photo avec trois voix différentes. Remplacez le prompt « calme et stable » par « énergique, large sourire » et comparez les prises.
Chaque modèle mentionné ici se trouve au même endroit, sur picassoia.com/en/all-models. Ouvrez la page, choisissez deux modèles d’avatars et réalisez votre première vidéo parlante avant que votre café ne refroidisse.