API de doublage vidéo par IA : traduire des vidéos automatiquement

Une API de doublage vidéo par IA transforme une vidéo en plusieurs langues, mais les services diffèrent : certains renvoient une piste audio, d’autres une vidéo synchronisée sur les lèvres. Découvrez les cinq étapes d’une requête, les modèles de doublage de Picasso IA, un schéma de gestion des tâches et les vérifications à faire avant publication.

API de doublage vidéo par IA : traduire des vidéos automatiquement
Cristian Da Conceicao
Fondateur de Picasso IA

Doubler une vidéo impliquait autrefois un traducteur, un comédien de doublage, un studio réservé et un ingénieur du son qui ajustait les syllabes entre les mouvements des lèvres. Une API de doublage vidéo par IA condense cette chaîne en une seule requête : vous envoyez une vidéo et une langue cible, et un clip finalisé vous revient dans la langue maternelle de quelqu’un d’autre. Le piège, c’est que le mot « API » ne recouvre pas les mêmes réalités selon les services. Certains renvoient une piste audio doublée, d’autres une vidéo synchronisée sur les lèvres, et d’autres encore ne fournissent que des briques (transcription, traduction, synthèse vocale) et vous laissent l’assemblage.

Cet article fait le tri. Vous verrez ce qui se passe à l’intérieur d’une requête de doublage, quels modèles de doublage vous pouvez exécuter aujourd’hui sur Picasso IA, comment encadrer une API de doublage asynchrone avec un gestionnaire de tâches, et ce qu’il faut vérifier avant qu’une vidéo traduite ne soit mise en ligne. Une précision honnête d’entrée de jeu : sur Picasso IA, les modèles de doublage fonctionnent dans le navigateur, tandis que l’API pour développeurs référence actuellement quatre modèles d’image et de vidéo. Ces deux faits comptent si vous prévoyez un pipeline automatisé, et les deux sont détaillés ci-dessous.

Un homme regarde une vidéo de cuisine doublée sur son téléphone, un casque autour du cou

Ce que fait réellement une API de doublage

La plupart des API de doublage paraissent simples de l’extérieur : une requête en entrée, une vidéo traduite en sortie. En coulisses, les mêmes cinq étapes s’enchaînent à chaque fois, et les connaître permet de savoir d’où vient un mauvais résultat.

Les cinq étapes d’une seule requête

ÉtapeCe qui se passeOù cela déraille en général
1. TranscriptionLa parole devient un texte horodatéNoms propres, jargon et voix qui se chevauchent sont mal entendus
2. TraductionLe texte passe dans la langue cibleFormulations littérales, niveau de formalité inadapté
3. Synthèse vocaleLes répliques traduites sont prononcées, idéalement avec un clone de la voix d’origineDiction plate, émotion perdue
4. Alignement temporelLa nouvelle piste est étirée ou raccourcie pour tenir dans chaque planLes phrases débordent sur le montage
5. Synchronisation labiale et assemblageLes mouvements de la bouche sont ajustés et la piste audio est replacée sur la vidéoDécalage, formes de bouche qui ne correspondent pas au son

Un service « en un appel » exécute les cinq étapes derrière un seul point d’accès. C’est rapide et il y a peu de réglages à faire. Une architecture par briques expose chaque étape séparément, ce qui vous permet de confier la deuxième étape à un traducteur humain ou de changer la voix de la troisième sans tout refaire.

Doublage, sous-titres et voix off

FormatVoix d’origineEffort du spectateurCorrespondance labialeUsage idéal
Sous-titresConservéeIl faut lire pendant la vidéoInutileDiscours denses, lecture automatique sans son
Voix offAtténuée sous la voix d’un traducteurÉcoute seuleAucuneInterviews, documentaires
Doublage IAClonée ou remplacéeÉcoute seuleFacultativeTutoriels, publicités, cours, vidéos sociales

Un comédien de doublage parle dans un microphone à condensateur, dans une cabine d’enregistrement capitonnée

La cabine ci-dessus représente la voie traditionnelle : un script, une voix humaine, une séance par langue. Elle reste le choix qui s’impose pour les campagnes phares. Mais pour une bibliothèque de 200 tutoriels, une série de webinaires ou une démo produit qui change chaque trimestre, personne ne réserve 200 séances multipliées par dix langues. C’est là qu’un pipeline de doublage automatisé se rentabilise.

💡 Astuce : Beaucoup de gens font défiler leurs contenus sans le son, donc un doublage ne remplace pas les sous-titres. Doublez la piste audio et gardez les sous-titres incrustés dans la même langue que la nouvelle piste.

Choisir une voie de doublage

Video Translate pour une sortie synchronisée sur les lèvres

Video Translate est ce qui se rapproche le plus, sur Picasso IA, d’un service de doublage en un appel. Vous importez un MP4, choisissez une langue de sortie et récupérez une vidéo doublée dont les mouvements des lèvres sont ajustés à la nouvelle piste audio. La liste des langues dépasse 150 entrées, y compris des variantes régionales comme l’espagnol (Mexique), le portugais (Brésil) ou l’arabe (Maroc), si bien qu’un seul modèle couvre la plupart des marchés qu’une petite équipe visera jamais.

Il propose deux modes. Speed est conçu pour un délai de traitement court, et precision, le mode par défaut, privilégie la qualité du résultat. Les clips d’exemple de la page du modèle ont pris 169 et 183 secondes à générer : prévoyez donc quelques minutes par vidéo courte, et non quelques secondes.

Le doublage ElevenLabs pour le clonage de voix

Dubbing d’ElevenLabs adopte une approche différente. Il prend en charge plus de 90 langues et dialectes, détecte automatiquement la langue source et conserve la voix, l’émotion et le rythme de l’intervenant d’origine. Un réglage de force de clonage allant de 0 à 10 (7 par défaut) détermine la ressemblance de la nouvelle voix avec l’originale : plus haut pour les interviews où l’identité compte, plus bas pour une diction plus naturelle dans la langue cible.

Il accepte aussi une URL publique, comme un lien direct vers un fichier, un lien YouTube ou un lien TikTok, ce qui permet de doubler une vidéo sans la télécharger au préalable. Le type de sortie annoncé est l’audio : vérifiez donc ce que vous obtenez pour votre fichier et replacez la nouvelle piste sur la vidéo d’origine si vous avez besoin d’un MP4 finalisé.

Assembler des briques dans votre propre pipeline

Si vous avez besoin d’un contrôle par langue, assemblez la chaîne vous-même : un modèle de transcription pour la première étape, un modèle de synthèse vocale ou de clonage de voix pour la troisième, et un modèle de synchronisation labiale pour la cinquième. Les sections suivantes détaillent les options. Le prix de cette souplesse, c’est le travail d’orchestration, que le schéma de gestion des tâches présenté plus loin dans cet article prend en charge.

VoieEntréeLanguesCorrespondance labialeIdéal pour
Video TranslateImport d’un MP4150+IntégréeVidéos finalisées pour de nouveaux marchés
Doublage ElevenLabsFichier ou URL publique90+Rythme conservéPodcasts, interviews, liens YouTube
Chaîne personnaliséeAu choixSelon les briquesAjoutez un modèle de synchronisation labialeContrôle par langue, relecture humaine

Vue de dessus d’un bureau avec un ordinateur portable, une mappemonde imprimée, des post-it, des écouteurs et une tasse

Utiliser Video Translate

Voici la façon la plus rapide de transformer une vidéo anglaise en vidéo espagnole, avec la version navigateur de Video Translate sur Picasso IA.

Traiter un clip étape par étape

  1. Ouvrez la page du modèle et connectez-vous à votre compte Picasso IA.
  2. Importez un MP4 dans le champ vidéo. Commencez par un extrait de 15 à 30 secondes avec une parole claire et un visage visible, et non par le webinaire complet de quarante minutes.
  3. Choisissez la langue de sortie. La valeur par défaut est l’anglais. Sélectionnez l’espagnol pour un large public, ou une entrée régionale comme l’espagnol (Mexique) lorsque la campagne vise un seul pays.
  4. Sélectionnez le mode. Laissez precision pour tout ce que vous comptez publier. Passez en speed lorsque vous vérifiez seulement que le script et le rythme fonctionnent.
  5. Lancez le modèle et patientez quelques minutes.
  6. Relisez le résultat avec un locuteur natif avant de lancer les neuf autres langues.

Trois collègues autour d’une table en chêne examinant une vidéo figée sur un ordinateur portable

Les paramètres qui valent la peine d’être modifiés

ModèleParamètreOptionsÀ modifier quand
Video Translatemodespeed, precision (par défaut)Les brouillons utilisent speed, les versions finales precision
Video Translateoutput_languagePlus de 150 noms et variantes régionalesLe public parle un dialecte régional précis
Doublage ElevenLabstarget_languageBalises BCP-47 comme es-MX, pt-BR, en-GBToujours requis
Doublage ElevenLabssource_languageauto (par défaut) ou une baliseLa détection choisit la mauvaise langue sur une voix accentuée
Doublage ElevenLabscloning_strength0 à 10, 7 par défautMontez-le pour coller au locuteur, baissez-le pour une diction naturelle
Doublage ElevenLabssource_url ou fichierLien public ou importDoubler une vidéo hébergée sans la télécharger

💡 Astuce : Les variantes régionales ne sont pas une question de forme. Un doublage en espagnol mexicain et un doublage en espagnol d’Espagne diffèrent par le vocabulaire et le rythme, et un clip publicitaire qui sonne étranger à son propre public perd la confiance que le doublage est censé construire.

Les enseignants et les créateurs de cours en tirent le meilleur parti. Une conférence enregistrée, doublée en hindi, en tamoul ou en portugais (Brésil), touche des étudiants qui, sinon, s’en remettraient aux sous-titres à leur vitesse de lecture.

Un enseignant devant un tableau blanc dans une salle de classe vide, une caméra sur trépied filme le cours

Construire un pipeline de doublage

Ce que propose l’API de Picasso IA

Picasso IA dispose d’une API pour développeurs à l’adresse https://api.picassoia.com/v1, authentifiée par un jeton Bearer. Elle suit le schéma asynchrone utilisé par la plupart des API d’IA : créer une prédiction pour un modèle, interroger son statut, puis récupérer le résultat. La page de l’API répertorie quatre modèles : deux pour les images et deux pour la vidéo, à savoir Picasso IA Video et Seedance 2.5 Lite. La paire vidéo produit des clips avec un son synchronisé.

Deux limites encadrent toute automatisation. Un compte peut avoir jusqu’à 5 prédictions en file d’attente ou en cours d’exécution à la fois, partagées entre ses jetons et ses connexions MCP. Et au moment de la rédaction, la page indique que la création de prédictions nécessite un forfait Infinite, tout en précisant que les prédictions API sont actuellement gratuites et ne consomment aucun crédit. Consultez la page pour les conditions en vigueur avant de construire quoi que ce soit dessus.

La conséquence pratique pour le doublage : aucun modèle de doublage, de traduction, de synchronisation labiale ou de synthèse vocale n’est exposé par l’API aujourd’hui. Ces modèles fonctionnent dans le navigateur. Une répartition raisonnable consiste à générer vos séquences sources via l’API, par exemple un clip Picasso IA Video de 5 secondes ou un clip Seedance 2.5 Lite de 5 ou 10 secondes, puis à lancer l’étape de doublage dans le navigateur ou via un fournisseur dont l’API expose le doublage.

Un développeur tape sur son ordinateur portable, à une table près de la fenêtre d’un café, avec un café et un carnet

Un schéma de gestion des tâches

Toute API de doublage à tâches asynchrones réclame le même encadrement : soumettre, interroger avec un délai croissant, respecter la limite de simultanéité et ne jamais perdre un identifiant de tâche. L’exemple ci-dessous utilise des routes fictives. Remplacez-les par les points d’accès et les noms de champs réels du fournisseur que vous choisissez.

import os
import time
import requests
from multiprocessing.pool import ThreadPool

BASE_URL = os.environ["PROVIDER_BASE_URL"]      # your dubbing provider
TOKEN = os.environ["PROVIDER_TOKEN"]
HEADERS = {"Authorization": f"Bearer {TOKEN}"}
SOURCE_URL = os.environ["SOURCE_VIDEO_URL"]     # public link to your MP4
LANGUAGES = ["es-MX", "pt-BR", "de", "ja", "hi"]
MAX_PARALLEL = 5                                # stay under the provider cap


def submit(language):
    r = requests.post(
        f"{BASE_URL}/dubbing/jobs",             # placeholder route
        headers=HEADERS,
        json={"source_url": SOURCE_URL, "target_language": language},
        timeout=60,
    )
    r.raise_for_status()
    job_id = r.json()["id"]
    print(f"{language}: submitted {job_id}")    # log it before waiting
    return job_id


def wait(job_id, timeout=3600):
    delay, deadline = 5, time.time() + timeout
    while time.time() < deadline:
        job = requests.get(
            f"{BASE_URL}/dubbing/jobs/{job_id}", headers=HEADERS, timeout=60
        ).json()
        if job["status"] == "succeeded":
            return job["output_url"]
        if job["status"] in ("failed", "canceled"):
            raise RuntimeError(job.get("error", "dubbing failed"))
        time.sleep(delay)
        delay = min(delay * 1.5, 60)            # gentle backoff
    raise TimeoutError(job_id)


def dub(language):
    try:
        return language, wait(submit(language))
    except Exception as exc:                    # one bad language must not stop the rest
        return language, f"ERROR: {exc}"


with ThreadPool(MAX_PARALLEL) as pool:
    for language, result in pool.imap(dub, LANGUAGES):
        print(language, result)

Trois habitudes de ce code méritent d’être reprises. Journalisez l’identifiant de tâche dès que vous le recevez, pour qu’un plantage ne laisse jamais orphelin un travail payé. Interrogez avec un délai qui augmente au lieu de bombarder la route de statut. Et gérez les erreurs par langue, afin qu’un doublage japonais raté n’arrête pas le doublage allemand.

Un calcul rapide : si chaque tâche prend environ trois minutes, comme les clips d’exemple ci-dessus, et que votre fournisseur en traite 5 à la fois, 20 langues demandent quatre séries, soit environ 12 minutes. Considérez ce chiffre comme une estimation, car les files d’attente réelles varient.

La synchronisation labiale après traduction

Pourquoi le calage se dérègle après traduction

Les phrases traduites ne correspondent que rarement à la longueur de l’original. L’espagnol et l’allemand dépassent souvent l’anglais, ce qui oblige le doublage à accélérer, couper ou réécrire. Même lorsque l’audio tient dans le temps imparti, la bouche reproduit toujours les formes d’origine : un « p » ou un « b » à lèvres closes en anglais peut tomber sur une voyelle ouverte dans le doublage. Les spectateurs le remarquent surtout en gros plan, donc un plan de présentateur demande plus de soin qu’un enregistrement d’écran avec une voix off.

Un présentateur parle à une caméra sur trépied, sous une lumière softbox, dans un petit studio à domicile

Les modèles de synchronisation labiale à enchaîner

Lorsque votre étape de doublage ne renvoie que l’audio, ou lorsque vous avez construit la chaîne vous-même, un modèle de synchronisation labiale dédié recale la bouche sur la nouvelle piste. Picasso IA répertorie plusieurs modèles dans la catégorie lipsync :

ModèleCe que promet la fiche
Lipsync 2 ProSynchroniser les lèvres sur l’audio
React 1Synchronisation labiale réaliste sur n’importe quelle vidéo
Kling Lip SyncFaire correspondre la bouche à l’audio dans n’importe quelle vidéo
Lipsync PrecisionDoublage axé sur la précision
Lipsync SpeedDoublage en quelques secondes, la vitesse d’abord

L’ordre habituel est le suivant : doublez l’audio, replacez-le sur la vidéo d’origine, puis transmettez la vidéo et la nouvelle piste au modèle de synchronisation labiale. Passez cette étape lorsque l’intervenant est hors champ, filmé de dos ou petit dans le cadre, car personne ne peut vérifier la bouche.

Voix et transcriptions

Transcrire d’abord la source

Une chaîne personnalisée commence par une transcription exacte. Picasso IA répertorie GPT-4o Transcribe, GPT-4o Mini Transcribe et Gemini 3 Pro dans la catégorie reconnaissance vocale. Quel que soit votre choix, relisez la transcription avant de traduire. Corrigez les noms de produits, les sigles et les noms de personnes une seule fois, et toutes les langues en profiteront. Un court glossaire identique pour toutes les langues cibles évite que votre marque soit traduite de neuf façons différentes.

Les mains d’un ingénieur du son sur les potentiomètres d’une console de mixage analogique

Choisir une voix par langue

Pour la troisième étape, la catégorie synthèse vocale offre de nombreuses options :

ModèlePourquoi le choisir
ElevenLabs v2 MultilingualVoix off en plus de 30 langues
Gemini 3.1 Flash TTS30 voix dans plus de 70 langues
Speech 2.8 HDVoix off de qualité studio
MiniMax Voice CloningVoix personnalisées à partir d’un échantillon
Qwen3 TTSCloner une voix ou en concevoir une nouvelle

Ne clonez que des voix pour lesquelles vous avez une autorisation, et conservez une trace écrite de cette autorisation avec le projet. Une voix de marque doit rester cohérente d’une langue à l’autre : choisissez un style de voix par langue et réutilisez-le pour toute la série.

Contrôles qualité avant publication

Trois erreurs courantes

1. Sauter la relecture par un natif. Le doublage automatique est bon, et pourtant il se trompe de façons que seule une oreille native repère : un registre soutenu là où la marque est décontractée, un nombre lu dans le mauvais ordre, une blague qui devient un non-sens. Dix minutes avec un relecteur bilingue coûtent moins cher qu’un nouveau tournage.

Un relecteur bilingue, casque sur les oreilles, écoute attentivement un clip doublé sur un ordinateur portable

2. Oublier ce qui est écrit à l’écran. Le doublage modifie l’audio. Il ne touche ni aux diapositives, ni au texte de l’interface, ni aux bandeaux, ni aux sous-titres incrustés dans les images. Prévoyez une seconde passe qui remplace ces éléments, sinon la voix espagnole commentera un écran en anglais.

3. Ignorer la bande sonore. La musique, les applaudissements et l’ambiance de la pièce se trouvent sous la parole d’origine. Écoutez-les dans le fichier doublé. Si la musique s’interrompt ou saccade, remixez le fond sonore d’origine sous la nouvelle voix.

Une courte liste de contrôle avant publication permet de garder des lots fiables :

  • Noms et chiffres lus correctement dans chaque langue
  • Durée à quelques secondes près de l’original, sans phrase coupée
  • Voix cohérente sur toutes les vidéos de la série
  • Texte à l’écran remplacé ou volontairement laissé dans la langue source
  • Niveaux audio alignés sur l’original, avec la musique toujours présente
  • Un auditeur natif a validé chaque langue

Essayer le doublage sur Picasso IA

Pas besoin de studio, de traducteur attitré ni d’une semaine de montage pour voir comment cela fonctionne. Ouvrez Video Translate, importez un clip de 20 secondes et lancez-le dans deux langues. Puis passez le même clip dans Doublage ElevenLabs avec la force de clonage réglée sur 3, puis sur 9, et écoutez la différence côte à côte.

Si vous voulez des images neuves à doubler, générez-les d’abord : Picasso IA crée des images et de courtes vidéos avec un son synchronisé, et l’ensemble du catalogue figure sur la page de tous les modèles. Expérimentez, comparez et gardez la version que votre public lancerait réellement.

Partager cet article

Choisissez votre langue