Une présentation de dix diapositives devrait prendre un après-midi. La narration, elle, prend le reste de la semaine. Vous enregistrez la diapositive 3, un chien aboie, vous recommencez, puis vous repérez un nom de produit mal prononcé sur la diapositive 7, et le ton des diapositives 1 à 6 ne correspond plus. La voix off IA pour PowerPoint, Premiere Pro et DaVinci Resolve met fin à cette boucle : vous rédigez le script une seule fois, générez un audio propre pour chaque diapositive ou scène, et insérez les fichiers dans l’outil de montage que vous utilisez déjà.
Cet article suit tout le parcours. Vous choisirez un modèle de voix, rédigerez un script qui sonne parlé plutôt que lu, le lancerez sur PicassoIA, puis intégrerez l’audio dans PowerPoint, Premiere Pro et DaVinci Resolve à l’aide de chemins de menus et de réglages précis. Le résultat est un flux de travail reproductible pour les présentations de formation, les vidéos YouTube, les démonstrations de produits et les présentations clients, sans aucun microphone.
Choisir le bon modèle de voix
Tous les modèles de synthèse vocale ne conviennent pas à tous les besoins. Une voix parfaite pour une démonstration de produit calme peut paraître plate sur une promo de 30 secondes au rythme soutenu. PicassoIA propose 24 modèles de synthèse vocale : la question utile est donc de savoir lesquels vous avez vraiment besoin, deux ou trois.

Les modèles côte à côte
Voici comment se comparent les options les plus utiles pour la narration de diapositives et de vidéos :
| Modèle | Idéal pour | Point fort |
|---|
| Speech 2.8 HD | Narration de diapositives, tutoriels, longs scripts | Dix styles d’émotion, export WAV et FLAC, marqueurs de pause en ligne, plus de 40 langues |
| Speech 2.8 Turbo | Premières versions rapides et réécritures express | La rapidité avant tout, même famille que 2.8 HD |
| ElevenLabs V3 | Narration expressive et lectures de personnages | Plus de 25 personnalités vocales, curseurs de style et de stabilité |
| ElevenLabs v2 Multilingual | Un seul script en plusieurs langues | Plus de 30 langues |
| Gemini 3.1 Flash TTS | Déploiements mondiaux | 30 voix, plus de 70 langues |
| Qwen3 TTS | Voix personnalisées ou clonées | Clonez une voix ou en concevez une nouvelle |
Choisissez un modèle par projet et gardez-le. Mélanger trois voix différentes dans une même présentation amène le public à remarquer l’audio plutôt que le message.
💡 Astuce : Générez le même paragraphe de 20 secondes avec trois modèles, écoutez-les les uns après les autres au casque, et choisissez avant de toucher au script final. Cinq minutes ici vous évitent un nouveau rendu complet plus tard.
Cloner votre propre voix
Si la présentation doit sonner comme vous, ou comme le porte-parole de votre entreprise, Voice Cloning crée une voix personnalisée réutilisable. L’identifiant de voix renvoyé s’insère directement dans Speech 2.8 HD, afin que chaque diapositive suivante garde le même son. Qwen3 TTS propose une démarche similaire si vous préférez concevoir une voix à partir d’une description. Ne clonez que des voix qui vous appartiennent ou pour lesquelles vous avez une autorisation écrite.

Rédiger un script qui sonne parlé
La synthèse vocale lit exactement ce que vous lui donnez. Un script écrit pour l’œil produit une narration raide, alors relisez-le pour l’oreille avant de générer quoi que ce soit.

Chiffres, sigles et pauses
Quelques habitudes règlent la plupart des moments robotiques :
- Gardez des phrases courtes. Visez 15 à 20 mots. Si vous manquez de souffle en la lisant à voix haute, le modèle paraîtra pressé lui aussi.
- Écrivez les termes difficiles comme ils se prononcent. Écrivez « S Q L » si vous voulez les lettres, « sequel » si vous voulez un mot.
- Activez English Normalization dans Speech 2.8 HD lorsque le script contient des dates, des prix ou de grands nombres.
- Ajoutez des marqueurs de pause. Taper
<#0.5#> insère une demi-seconde de silence, idéal juste après un changement de diapositive.
- Lisez-le une fois à voix haute. Tout ce qui vous fait trébucher fera trébucher le modèle.
La narration défile à environ 150 mots par minute, soit environ 2,5 mots par seconde. Utilisez ce tableau pour dimensionner chaque diapositive avant de l’écrire :
| Durée de la diapositive ou de la scène | Nombre de mots visé |
|---|
| 10 secondes | Environ 25 mots |
| 20 secondes | Environ 50 mots |
| 30 secondes | Environ 75 mots |
| 60 secondes | Environ 150 mots |
Un fichier par diapositive ou par scène
Générez chaque diapositive sous forme de fichier audio distinct et nommez-les dans l’ordre : slide-01.wav, slide-02.wav, et ainsi de suite. Lorsqu’un client modifie le texte de la diapositive 6, vous régénérez un seul fichier au lieu de refaire toute la narration, et chaque autre diapositive garde sa synchronisation exacte. La même règle s’applique à la vidéo : un fichier par scène, dans l’ordre de votre timeline.
Utiliser Speech 2.8 HD sur PicassoIA
Speech 2.8 HD est le modèle de référence de ce flux de travail, car il exporte un audio sans perte, accepte des pauses en ligne et vous donne un contrôle direct sur l’émotion et la vitesse.

Étape 1 : collez votre script
Ouvrez la page du modèle et collez la narration d’une diapositive dans le champ Text. Une exécution accepte jusqu’à 10 000 caractères, bien plus que n’en exige une diapositive. Ajoutez dès maintenant vos marqueurs de pause.
Étape 2 : réglez la voix, l’émotion et la vitesse
Voici les réglages qui comptent pour obtenir un audio prêt pour le montage :
| Réglage | Valeur recommandée | Pourquoi |
|---|
| Voice ID | Wise_Woman (par défaut) ou une voix explicative comme English_Explanatory_Man | Diction claire et stable |
| Emotion | calm ou neutral pour la formation, auto pour le marketing | Garde un ton cohérent |
| Speed | 0,95 à 1,05 | La plage autorisée va de 0,5 à 2,0, mais de petites variations sonnent naturellement |
| Pitch | 0 | La plage va de moins 12 à plus 12 demi-tons |
| Language boost | English ou Automatic | Aide avec les noms et les termes étrangers |
| English normalization | Activée pour les nombres et les dates | Ajoute un peu de latence |
| Audio format | WAV | Sans perte, accepté par tous les logiciels de montage |
| Sample rate | 44100 | La valeur la plus élevée proposée |
| Channel | mono | Une seule voix nécessite un seul canal |
| Subtitle enable | Activé si vous voulez des sous-titres | Renvoie des horodatages au niveau de la phrase |
Étape 3 : générez, écoutez, téléchargez
Lancez le modèle, puis écoutez au casque. Modifiez un seul réglage à la fois : si la phrase paraît trop enthousiaste, changez l’émotion avant de toucher à la vitesse. Lorsque le rendu vous convient, téléchargez le fichier et renommez-le pour qu’il corresponde à sa diapositive.
Trois erreurs reviennent sans cesse. Générer une présentation entière en un seul long fichier rend les modifications ultérieures pénibles. Pousser la vitesse à 1,3 pour faire tenir une diapositive trop chargée rend la voix précipitée, donc supprimez plutôt des mots. Et sauter l’écoute au casque laisse passer de petites erreurs de prononciation jusqu’à l’export final. Consacrez la minute supplémentaire par diapositive, et l’étape du montage restera fluide.
💡 Astuce pour ElevenLabs V3 : ElevenLabs V3 dispose des champs Previous Text et Next Text. Collez la diapositive précédente et la suivante, et le modèle ajuste l’intonation aux frontières afin que la voix s’enchaîne d’une diapositive à l’autre.
Voix off IA pour PowerPoint
PowerPoint est l’endroit le plus rapide pour constater le résultat. Une présentation commentée peut être partagée sous forme de vidéo, diffusée sur un kiosque ou envoyée à des personnes qui ne rejoindront jamais un appel en direct.

Attacher l’audio à chaque diapositive
- Sélectionnez la première diapositive dans le volet des miniatures.
- Choisissez Insertion, puis Audio, puis Audio sur mon PC et sélectionnez
slide-01.wav.
- Dans l’onglet Lecture, réglez Début sur Automatiquement et cochez Masquer pendant la diaporama pour qu’aucune icône de haut-parleur n’apparaisse.
- Cliquez sur Recadrer l’audio pour lire la durée exacte du clip.
- Dans l’onglet Transitions, cochez Après sous Passer à la diapositive suivante et saisissez cette durée, plus une demi-seconde de marge.
- Répétez pour chaque diapositive.
L’audio démarre désormais tout seul, et la diapositive passe à la suivante à la fin de la phrase. Aucun clic n’est nécessaire pendant la lecture. Si une diapositive contient des animations, réglez-les sur Début : Après le précédent afin que la séquence d’apparition suive la voix au lieu d’attendre un clic.
💡 Astuce : Pour les présentations qui voyagent par e-mail, exportez la narration depuis Speech 2.8 HD en MP3 à 128 kbit/s au lieu de WAV. Le fichier reste léger, et personne ne remarquera la différence sur les haut-parleurs d’un ordinateur portable.
Exporter une vidéo commentée
Allez dans Fichier, puis Exporter, puis Créer une vidéo. Choisissez Full HD (1080p), gardez Utiliser les minutages et narrations enregistrés sélectionné et cliquez sur Créer la vidéo. PowerPoint respecte les durées de passage que vous avez saisies, si bien que la vidéo correspond à l’audio à la seconde près.
Voix off IA dans Premiere Pro
Dans un montage vidéo, la voix sert de repère. L’audio IA ne dérive jamais en rythme d’une prise à l’autre : vous pouvez donc verrouiller la narration en premier, puis couper les images pour qu’elles s’y calent.

Importer et synchroniser sur la timeline
- Appuyez sur Ctrl+I (Cmd+I sur Mac) et importez tous les fichiers de voix dans un bac nommé VO.
- Faites glisser
scene-01.wav sur A1 au début de la séquence, puis placez les fichiers suivants les uns après les autres.
- Utilisez l’outil Lame de rasoir (C) et la suppression par ondulation pour réduire tout blanc plus long que souhaité.
- Appuyez sur M sur les mots exacts où un plan doit changer, puis coupez vos rushes sur ces marqueurs.
Premiere convertit automatiquement les fichiers à 44,1 kHz vers la séquence à 48 kHz : inutile de rééchantillonner manuellement.
Nettoyer avec Essential Sound
Ouvrez Fenêtre, puis Essential Sound, sélectionnez les clips de voix et cliquez sur Dialogue. Sous Loudness, appuyez sur Auto-Match. Placez la musique sur sa propre piste, étiquetez-la Musique, et activez le Ducking face aux clips de dialogue afin que la bande-son baisse dès que la voix parle. Si un son S paraît trop aigu, ajoutez l’effet DeEsser à la piste de voix.
| Piste | Contenu | Cible |
|---|
| A1 | Voix off IA | Étiquetée Dialogue, Auto-Match |
| A2 | Musique | Étiquetée Musique, en ducking sous A1 |
| A3 | Effets sonores | En retrait dans le mixage, jamais plus fort que la voix |
| Mixage final | Séquence complète | Autour de moins 14 LUFS pour la vidéo web |
💡 Astuce : Si une réplique sonne mal, ne la corrigez pas avec des plugins. Modifiez le texte, régénérez ce seul fichier avec des réglages identiques et remplacez-le sur la timeline. Cela prend moins de temps que de le corriger à l’oreille.
Voix off IA dans DaVinci Resolve
Resolve récompense la même approche. Verrouillez la voix, puis construisez tout le reste autour. La version gratuite de Resolve suffit pour chacune des étapes ci-dessous.

Construire le montage sur la page Edit
- Appuyez sur Ctrl+I ou faites glisser vos fichiers de voix dans le Media Pool.
- Sur la page Edit, déposez chaque fichier sur Audio 1 dans l’ordre des scènes.
- Appuyez sur B pour l’outil Lame afin de couper les silences au début et à la fin de chaque clip, puis refermez les espaces avec une suppression par ondulation.
- Appuyez sur M pour poser des marqueurs de timeline aux mots où l’image doit changer.
Resolve rééchantillonne lui-même les fichiers à 44,1 kHz vers la timeline à 48 kHz.
Équilibrer les niveaux dans Fairlight
Passez à la page Fairlight. Faites un clic droit sur les clips de voix et choisissez Normaliser les niveaux audio afin que chaque scène atteigne le même volume. Vérifiez le résultat sur le vumètre de volume, puis ajustez le bus Main 1 jusqu’à ce que la timeline finale se situe autour de moins 14 LUFS pour une diffusion web. Pour la musique, réglez le volume à la main avec l’automatisation, ou utilisez un compresseur sur la piste musicale avec la voix comme side-chain.
Voici comment les trois outils se comparent sur les mêmes tâches :
| Tâche | PowerPoint | Premiere Pro | DaVinci Resolve |
|---|
| Importer l’audio | Insertion, Audio, Audio sur mon PC | Fichier, Importer | Fichier, Importer, Média |
| Meilleur format de fichier | MP3 à 128 kbit/s | WAV | WAV |
| Méthode de synchronisation | Passer à la diapositive suivante, Après | Outil Lame de rasoir et suppression par ondulation | Outil Lame et suppression par ondulation |
| Harmonisation des niveaux | Volume de lecture | Essential Sound, Auto-Match | Normaliser les niveaux audio dans Fairlight |
| Export | Créer une vidéo | Exporter (Ctrl+M) | Page Deliver |
Sous-titres, doublage et visuels
La voix off ne représente qu’une partie du résultat final. Le même script alimente les sous-titres, les traductions et les images à l’écran.

Sous-titres et doublage à partir d’un seul script
Pour les sous-titres, activez les métadonnées de sous-titres dans Speech 2.8 HD afin d’obtenir des horodatages au niveau de la phrase, ou faites passer l’audio final dans GPT-4o Transcribe pour obtenir une transcription, puis incrustez les sous-titres dans un clip exporté avec Autocaption.
Pour d’autres langues, vous disposez de deux méthodes simples :
Pour ajouter une nouvelle piste vocale à un MP4 existant sans ouvrir de logiciel de montage, Video Audio Merge remplace ou mixe la bande-son.
Visuels de diapositives et plans d’insert fixes
Une excellente narration sur des images faibles finit tout de même par perdre le public. Générez des images fixes photographiques pour vos diapositives et vos plans d’insert avec un modèle de texte vers image : P Image est rapide pour les brouillons, tandis que Seedream 4.5 et FLUX.2 Pro conviennent aux images phares. Décrivez l’objectif, la lumière et les textures de surface, et réglez le format sur 16:9 pour que l’image remplisse une diapositive ou une image de timeline sans recadrage.

Essayez-le sur votre prochain projet
Choisissez la présentation ou la vidéo que vous repoussez depuis trop longtemps. Collez sa première diapositive dans Speech 2.8 HD sur PicassoIA, lancez l’exécution et déposez le fichier dans PowerPoint, Premiere Pro ou DaVinci Resolve. Générez ensuite la diapositive suivante avec une autre voix et comparez. Au troisième fichier, vous saurez quelle voix convient à votre contenu et quels réglages vous n’aurez plus jamais à toucher.
Tout ce flux de travail tient en un seul endroit : voix, transcription, sous-titres, doublage et génération d’images. Parcourez le catalogue complet sur picassoia.com/en/all-models, testez deux ou trois voix sur votre propre script, et laissez votre prochaine présentation se raconter toute seule.