Vous avez un script, une échéance et deux modèles vocaux MiniMax qui se ressemblent presque sur le papier. Speech 2.8 HD et Speech 2.8 Turbo acceptent le même texte, les mêmes voix et les mêmes réglages, pourtant HD coûte 67 % de plus par caractère, alors que Turbo a terminé ses exemples publiés en moins de la moitié du temps. Lequel doit donc trouver sa place dans votre chaîne de narration, et une voix clonée change-t-elle la réponse ?
Cet article met les deux modèles côte à côte sur la qualité vocale, la vitesse, le clonage vocal et les tarifs réels, avec des exemples de coûts détaillés que vous pouvez adapter à vos propres scripts. Il montre aussi comment utiliser les deux sur PicassoIA, pour entendre la différence avant de dépenser quoi que ce soit sur un gros projet.
💡 Réponse courte : Choisissez HD pour une narration finale, les livres audio et tout contenu écouté au casque. Choisissez Turbo pour les brouillons, les gros volumes et tout travail où la différence entre 60 $ et 100 $ par million de caractères s’additionne.
Deux modèles, une vraie différence
Les deux modèles viennent de MiniMax et appartiennent à une famille de synthèse vocale qui comprend aussi Speech 2.6 HD et Speech 2.6 Turbo. Les noms racontent déjà l’essentiel. HD sacrifie la vitesse à la fidélité. Turbo sacrifie un peu de fini à la vitesse et à une facture plus légère.
Ce pour quoi HD est conçu
Les descriptions publiées de Speech 2.8 HD insistent sur le détail tonal, les émotions nuancées et la respiration naturelle, avec les gains les plus nets dans les lectures à faible énergie : une lecture douce, fatiguée ou réfléchie. La page du modèle HD sur Replicate indique aussi qu’il est arrivé premier de deux classements publics de synthèse vocale, dont l’un hébergé sur Hugging Face. Les classements évoluent, vérifiez donc les positions actuelles avant de reprendre cette affirmation. Pensez aux livres audio, à la narration documentaire et aux vidéos de marque où une phrase plate se remarque.
Ce pour quoi Turbo est conçu
Speech 2.8 Turbo est optimisé pour la vitesse, la faible latence et le volume. La fiche de Replicate lui attribue une latence inférieure à 250 millisecondes, et les descriptions publiées indiquent que ses meilleurs résultats se trouvent dans les registres très énergiques, comme les publicités dynamiques, les annonces de produits et les réponses rapides au service client. Il partage la même bibliothèque de voix, les mêmes indications de langue et la même liste d’émotions, si bien que passer de l’un à l’autre implique rarement de réécrire un script.

| Caractéristique | Speech 2.8 HD | Speech 2.8 Turbo |
|---|
| Conçu pour | Fidélité, détail tonal, émotion subtile | Vitesse, faible latence, volume |
| Tarif public | 100 $ par 1M de caractères | 60 $ par 1M de caractères |
| Durée d’exécution publiée | Environ 5,8 secondes | Environ 2,0 et 2,5 secondes |
| Limite de saisie | 10 000 caractères par requête | 10 000 caractères par requête |
| voice_id cloné | Accepté dans le champ voice_id | Accepté dans le champ voice_id |
| Formats de sortie | MP3, WAV, FLAC, PCM | MP3, WAV, FLAC, PCM |
| Émotions | auto plus neuf styles | auto plus neuf styles |
Réglages, qualité et vitesse comparés
Sur PicassoIA, les deux modèles exposent exactement les mêmes entrées, ce qui rend la comparaison équitable : changez seulement le modèle et tous les autres réglages restent en place.
Les réglages communs aux deux modèles
- voice_id : vaut Wise_Woman par défaut. Les fiches de Replicate citent 17 préréglages ou plus, dont Deep_Voice_Man, Imposing_Manner, Casual_Guy, Lively_Girl, Young_Knight et Abbess.
- emotion : auto, happy, sad, angry, fearful, disgusted, surprised, calm, fluent ou neutral.
- language_boost : None, Automatic ou l’une des quelque 40 langues nommées. La liste est identique sur les deux modèles, donc le nombre de langues ne doit pas décider de votre choix.
- speed, pitch, volume : vitesse de 0,5 à 2,0, hauteur de -12 à +12 demi-tons, volume de 0 à 10.
- Marqueurs de pause : saisissez un marqueur comme
<#0.5#> dans le texte pour insérer une pause d’une demi-seconde.
- english_normalization : améliore la lecture des nombres et des dates en anglais, au prix d’une légère latence.
- Options de sortie : MP3, WAV, FLAC ou PCM ; débit MP3 de 32 à 256 kbit/s ; fréquence d’échantillonnage de 8 000 à 44 100 Hz ; mono ou stéréo ; horodatages facultatifs des sous-titres par phrase.

Ce que vous entendez et ce que vous attendez
D’abord la qualité. Les deux modèles produisent une parole claire et naturelle, et l’écart apparaît dans les détails : le souffle avant une phrase, la façon dont une réplique triste s’éteint, les micro-pauses à l’intérieur d’une longue proposition. C’est dans ces détails que HD est conçu pour gagner. Dans une lecture rapide et enjouée, l’écart se réduit, et c’est pourquoi Turbo tient bien dans les publicités et les annonces.
Ensuite la vitesse. L’exemple publié sur la page HD a pris environ 5,8 secondes pour une seule phrase. Les deux exemples Turbo ont pris environ 2,0 et 2,5 secondes pour des phrases de longueur similaire. Trois essais forment une anecdote, pas un benchmark, et les temps d’attente varient, mais la tendance correspond aux noms des produits.
Un test d’écoute équitable prend dix minutes :
- Choisissez un paragraphe de 150 mots qui contient un nombre, une date, un nom, une question et une réplique calme.
- Lancez-le sur les deux modèles avec le même voice_id, la même emotion et la même vitesse.
- Écoutez les extraits au casque, puis sur le haut-parleur d’un téléphone.
- Notez lequel vous publieriez sans montage.

💡 Astuce : Ne changez qu’une variable à la fois. Si vous changez le modèle et l’émotion en même temps, vous ne saurez jamais quel changement a amélioré l’extrait.
Le clonage vocal transforme un court enregistrement en voice_id réutilisable. Sur PicassoIA, ce travail revient à Voice Cloning, un modèle distinct dont vous collez la sortie dans le champ voice_id d’un modèle de synthèse vocale. Les deux modèles 2.8 prennent en charge cette fonction : leur champ voice_id permet de choisir une voix système MiniMax ou un ID renvoyé par le modèle de clonage.
Enregistrer un échantillon propre
Le modèle de clonage accepte des fichiers MP3, M4A ou WAV de 10 secondes à 5 minutes, de moins de 20 Mo. Il propose aussi la réduction de bruit, la normalisation du volume et un seuil de précision de 0 à 1, fixé par défaut à 0,7. La fiche de Replicate indique qu’une référence de 5 secondes peut suffire, mais précise que des échantillons plus longs améliorent la précision : visez donc 30 à 60 secondes de parole claire.
- Enregistrez dans une pièce petite et douce. Une penderie pleine de manteaux vaut mieux qu’une cuisine vide.
- Gardez une distance constante avec le micro et lisez sur le ton que vous voulez donner à la voix.
- Évitez la musique, l’écho et un second locuteur.
- N’activez la réduction de bruit que si le fichier présente un souffle de fond, car une prise propre vaut mieux qu’un nettoyage.

💡 Autorisation : Ne clonez que la voix que vous possédez ou pour laquelle vous avez une autorisation écrite. Une cession signée par un comédien ou un client prend deux minutes et lève tous les doutes ensuite.
La question 2.6 ou 2.8
Voici le point à connaître. Le réglage de modèle dans Voice Cloning liste Speech 2.6 Turbo, Speech 2.6 HD, Speech 02 Turbo et Speech 02 HD, avec 2.6 HD par défaut. Speech 2.8 ne figure pas dans cette liste, bien que le champ voice_id de la version 2.8 accepte les ID renvoyés par le modèle de clonage. Le schéma seul ne dit pas dans quelle mesure une voix entraînée sur un niveau 2.6 se transpose en 2.8.
Faites donc le test. Clonez une fois avec le niveau par défaut, puis prononcez la même réplique avec 2.8 HD, 2.8 Turbo et 2.6 HD. Comparez chaque résultat à votre enregistrement d’origine. Si 2.8 s’éloigne du locuteur, utilisez 2.6 HD pour la voix clonée et réservez 2.8 aux voix de la bibliothèque.
Utiliser votre voice_id cloné
Après le clonage, copiez le voice_id renvoyé dans le champ voice_id de l’un des deux modèles 2.8, puis rédigez le script de votre choix. Le clonage est facturé 1,50 $ par voix, au premier usage de synthèse, et une voix peut être réutilisée dans toutes les exécutions suivantes. Testez emotion et language_boost sur la voix clonée avec une courte réplique avant de vous engager sur un long script.
Si le clonage MiniMax ne correspond pas à votre locuteur, deux autres modèles valent un bref essai : Qwen3 TTS, présenté comme capable de cloner n’importe quelle voix ou de concevoir la vôtre, et Chatterbox, qui associe le clonage au contrôle de l’émotion.
Ce que cela coûte vraiment
Les chiffres ci-dessous sont les tarifs publics de MiniMax pour les modèles 2.8, tels que repris par des sites de tarifs tiers. Ils constituent la façon la plus claire de comparer les deux modèles. Ce que vous payez sur une plateforme précise dépend de l’offre propre à cette plateforme ; considérez donc ces chiffres comme une base pour choisir entre HD et Turbo, et non comme une facture PicassoIA. Les tarifs changent : vérifiez-les sur la page tarifaire de MiniMax avant de budgéter un gros projet.
Prix par million de caractères
| Élément | HD | Turbo |
|---|
| Pour 1 000 000 de caractères | 100 $ | 60 $ |
| Pour 1 000 caractères | 0,10 $ | 0,06 $ |
| Pour une requête de 10 000 caractères | 1,00 $ | 0,60 $ |
Turbo coûte 40 % de moins que HD, et HD coûte 67 % de plus que Turbo. Les deux affirmations sont vraies ; elles décrivent le même écart vu de deux extrémités. Le clonage vocal est un supplément forfaitaire : 1,50 $ par voix, au premier usage de synthèse.

Scripts réels, totaux réels
Ces totaux supposent environ 6 caractères par mot, espaces compris, et un rythme de narration de 150 mots par minute.
| Projet | Caractères | HD | Turbo | Économie avec Turbo |
|---|
| Lecture publicitaire de 60 secondes (150 mots) | 900 | 0,09 $ | 0,054 $ | 0,036 $ |
| Narration d’un article de 2 500 mots | 15 000 | 1,50 $ | 0,90 $ | 0,60 $ |
| 200 épisodes de podcast de 8 000 caractères | 1 600 000 | 160,00 $ | 96,00 $ | 64,00 $ |
| Livre audio de 10 heures (90 000 mots) | 540 000 | 54,00 $ | 32,40 $ | 21,60 $ |
Une voix clonée personnalisée ajoute 1,50 $ une seule fois. Narrer ces 15 000 caractères avec une voix clonée coûte donc 3,00 $ au total sur HD, ou 2,40 $ sur Turbo.
Les reprises sont le multiplicateur caché. Régénérez un script de 15 000 caractères quatre fois pour peaufiner la diction et HD coûte 6,00 $. Faites trois passes de brouillon sur Turbo (2,70 $) puis terminez une fois sur HD (1,50 $) : le total est de 4,20 $, soit une économie de 30 % avec la prise finale toujours rendue sur HD.
💡 Astuce : Chaque paragraphe régénéré est de nouveau facturé. Corrigez la ponctuation, les nombres et les marqueurs de pause dans le script avant de cliquer sur générer, pas après la troisième reprise.
Lequel choisir
Choisissez selon la fonction de l’audio, et non selon le modèle qui semble le plus impressionnant isolément.
Choisissez HD quand
- L’audio est le produit : livres audio, formations, narration documentaire et films de marque.
- Le script contient des passages calmes, tristes ou réfléchis qui ne doivent pas sonner plats.
- Les auditeurs vont passer plus de quelques minutes avec la voix au casque.
- Le fichier sera publié sans passe de relecture humaine.
Choisissez Turbo quand
- Vous rédigez, itérez ou vérifiez le rythme.
- Le volume compte : des centaines de courts clips, des descriptions de produits ou des voix de notification.
- La lecture est enjouée et énergique, comme les publicités, les annonces et les clips pour les réseaux sociaux.
- Vous prototypez un assistant vocal où le temps de réponse compte.
Brouillon sur Turbo, finition sur HD
Le flux de travail le moins cher utilise les deux. Figez le script, la voix et l’émotion sur Turbo, où chaque passe coûte 40 % de moins et revient plus vite. Une fois le texte définitif, générez la prise retenue sur HD. Comme les deux modèles partagent tous leurs réglages, les mêmes entrées se transposent sans modification.

Les projets multilingues en profitent le plus. Changez language_boost, auditionnez chaque langue sur Turbo, puis finalisez les versions approuvées sur HD. Faites écouter dix secondes de chaque version par un locuteur natif avant de publier, car les accents approximatifs passent inaperçus pour les oreilles de personnes qui parlent cette langue comme langue seconde.

Utiliser Speech 2.8 sur PicassoIA
Le parcours est le même sur les deux modèles. Ouvrez la page Speech 2.8 HD ou la page Speech 2.8 Turbo et parcourez les champs ci-dessous.
Configuration pas à pas
- Collez votre script dans le champ de texte (jusqu’à 10 000 caractères). Ajoutez des pauses avec des marqueurs comme
<#0.8#>.
- Choisissez un voice_id. Gardez Wise_Woman ou collez un voice_id cloné.
- Réglez l’émotion. Commencez par auto, puis figez un style une fois que vous connaissez le ton voulu.
- Réglez language_boost. Choisissez Automatic pour un texte mêlé ou une langue nommée pour un script monolingue.
- Ajustez la vitesse, la hauteur et le volume. De petits écarts font une grande différence. Essayez une vitesse entre 0,95 et 1,15.
- Choisissez la sortie. MP3 à 128 kbit/s pour les brouillons, MP3 à 256 kbit/s ou WAV pour les versions finales, et la stéréo seulement si votre logiciel de montage en a besoin.
- Générez, écoutez, téléchargez. Relancez jusqu’à ce que la prise soit juste, puis enregistrez le fichier.
💡 Astuce : Activez english_normalization lorsqu’un script regorge de nombres, de dates ou de prix. Cela ajoute une légère latence, mais leur lecture est plus naturelle.

Réglages de départ à reprendre
| Projet | emotion | speed | pitch | Sortie |
|---|
| Narration YouTube | auto | 1,2 | +2 | MP3, 128 kbit/s |
| Démonstration de produit | fluent | 1,0 | 0 | MP3 stéréo |
| Chapitre de livre audio | calm | 0,95 | 0 | WAV avec pauses minutées |
| Lecture publicitaire sur Turbo | happy | 1,1 | 0 | MP3, 256 kbit/s |
Considérez-les comme des points de départ et ajustez à l’oreille. Les deux premières lignes suivent les cas d’usage listés sur la page du modèle HD.
Ajouter de la musique et vérifier les transcriptions
Une voix fonctionne rarement seule. Pour un fond musical, demandez à Music 2.6, Lyria 3 Pro ou ElevenLabs Music un instrumental à faible énergie et au tempo stable, puis placez-le nettement sous la narration dans votre logiciel de montage pour que chaque mot reste clair.
Pour le contrôle qualité, passez chaque clip terminé dans un modèle de reconnaissance vocale comme GPT-4o Transcribe ou Gemini 3 Pro, et comparez la transcription avec votre script. Un mot qui ne correspond pas indique généralement un nom ou un nombre mal prononcé. GPT-4o Mini Transcribe est une autre option pour les longs lots. La même astuce fonctionne sur un échantillon de clonage : transcrivez d’abord votre enregistrement pour confirmer que l’audio est clair avant de dépenser 1,50 $ pour une voix.

Essayez les deux voix vous-même
La façon la plus rapide de trancher entre HD et Turbo est d’entendre les deux lire vos propres mots. Ouvrez PicassoIA, collez un paragraphe de votre prochaine vidéo, de votre podcast ou de votre leçon, et lancez-le sur Speech 2.8 HD et Speech 2.8 Turbo avec des réglages identiques. Clonez votre propre voix si vous voulez un narrateur personnel, ajoutez un fond musical, vérifiez la transcription et retenez la prise que votre public ne sautera pas. Faites vos brouillons à petit prix, finalisez avec soin, et construisez l’ensemble du projet au même endroit.