ElevenLabs v4 : les nouveautés pour les voix et l’API
ElevenLabs a lancé Eleven v4 et v4 Turbo le 28 septembre 2026. Cet article détaille plus de 90 langues, les balises audio cumulables, le clonage vocal à partir de 10 secondes, les nouveaux identifiants de modèle, la latence et les tarifs, puis montre comment rédiger des scripts avec ElevenLabs v3 sur PicassoIA dès aujourd’hui.
Le 28 septembre 2026, ElevenLabs a lancé deux modèles de synthèse vocale en même temps : Eleven v4 et Eleven v4 Turbo. Si vous développez des fonctionnalités vocales, narrez des vidéos ou produisez un podcast, voici l’essentiel : davantage de langues, des balises audio que vous pouvez cumuler, une limite de requête plus élevée et un modèle rapide conçu pour les agents vocaux en direct. La version détaillée suit, avec les chiffres, les changements de l’API et une méthode concrète pour répéter vos scripts dès aujourd’hui.
💡 Attention : ElevenLabs propose une remise de lancement de deux semaines sur l’API, qui prend fin le 12 octobre 2026. Si vous comptez tester v4 en volume, cette date compte plus que n’importe quelle fonctionnalité de cette page.
Ce qu’est vraiment Eleven v4
ElevenLabs a annoncé les deux modèles le même jour, et tous deux sont disponibles sur sa plateforme d’agents, son studio de création et l’API publique. L’argument est simple : des voix qui sonnent comme une personne qui joue un rôle, et non comme une personne qui lit.
Eleven v4 est le modèle expressif. C’est celui à privilégier quand la performance compte : livres audio, bandes-annonces, dialogues de personnages, publicités. Eleven v4 Turbo sacrifie un peu d’amplitude expressive pour gagner en vitesse. Il est conçu pour les agents vocaux, le type de produit où une pause d’une demi-seconde donne à l’interlocuteur l’impression que la ligne a coupé.
Les deux s’inscrivent dans la lignée d’Eleven v3, qui prenait déjà en charge les balises audio intégrées. v4 reprend cette idée et s’attaque aux points faibles : des voix qui dérivent sur les longues lectures, une liste de langues qui s’arrêtait à environ 70, et l’absence de prise en charge des clones vocaux professionnels.
Ces chiffres proviennent de l’article de lancement d’ElevenLabs, de sa documentation des modèles et des articles de presse de la première semaine. Lorsqu’un chiffre manque, c’est que l’entreprise ne l’a pas publié ; je l’ai indiqué comme non publié plutôt que de le deviner.
Des voix plus cohérentes
Des balises audio que vous pouvez cumuler
La nouveauté principale concerne la direction vocale. Vous écrivez les balises directement dans le texte, entre crochets, et le modèle en tient compte. ElevenLabs donne des exemples comme [laughs], [said angrily in French accent], [light rain] et [phone buzzing]. Remarquez que la liste mélange émotion, accent et effets sonores dans une seule syntaxe.
La nouveauté, c’est le cumul. Selon TechCrunch, vous pouvez désormais placer plusieurs balises à la suite, et le modèle suit la séquence au lieu de n’en retenir qu’une. Une ligne peut ressembler à ceci :
[whispers] The door was already open. [footsteps] [light rain] Somebody had been here.
Il s’agit d’une illustration du style, et non d’un exemple tiré de la documentation : testez vos propres formulations. Les balises courtes et concrètes sont généralement plus sûres que les balises poétiques.
Une cohérence sur les longs scripts
Si vous avez déjà généré un chapitre par morceaux, vous connaissez le problème : la ligne 40 semble lue par un autre narrateur que la ligne 3. ElevenLabs affirme que v4 prend en compte le ton, le rythme et le contexte de l’ensemble du script et conserve une voix stable, même lorsque vous régénérez une seule ligne plus tard.
Un chiffre accompagne cette affirmation. The Decoder rapporte un score de prononciation de 91,7 % pour v4, contre 85,6 % pour v3. Il s’agit d’un chiffre du fournisseur : considérez-le comme une indication de tendance, et non comme une promesse pour votre script.
💡 Conseil : Les longues productions exigent de prévoir les reprises. Générez paragraphe par paragraphe, gardez chaque paragraphe sous la limite de caractères et ne régénérez que les lignes qui ne vous plaisent pas. La cohérence de v4 est censée rendre ce flux de travail sûr.
Plus de 90 langues et accents
La liste des langues passe d’environ 70 à plus de 90. TechCrunch relève des gains de qualité visibles en japonais, en portugais brésilien, en mandarin et en cantonais, et la presse mentionne de nouvelles langues prises en charge, comme le mongol et l’odia.
Un détail facile à manquer : les voix clonées qui parlent une autre langue conservent un accent natif pour cette langue et ne glissent pas vers l’accent du locuteur d’origine au fil du texte. Pour qui adapte la voix d’une marque, c’est la différence entre une lecture espagnole crédible et une lecture américaine qui utilise des mots espagnols.
Pour les classements externes, ElevenLabs affirme que v4 arrive en première position d’un classement indépendant de synthèse vocale, avec un score Elo de 1319 rapporté dans les articles de lancement. Lors de tests en aveugle, l’entreprise cite environ 75 % d’auditeurs qui préfèrent v4 aux modèles concurrents, tandis que The Decoder situe la fourchette entre 65 et 81 % selon le concurrent.
💡 Retour à la réalité : Les classements utilisent de courtes phrases de test. Testez votre propre script, dans votre propre langue, avant d’engager un projet sur un modèle quel qu’il soit.
Le clonage vocal progresse
Des clones instantanés à partir de 10 secondes
Les clones vocaux instantanés ne demandent que 10 secondes d’audio. ElevenLabs affirme que la nouvelle architecture rend le clonage plus rapide et préserve mieux l’identité de la voix sur un passage plus long. Une bibliothèque de voix plus vaste aide aussi : les articles de lancement mentionnent plus de 17 500 voix au choix.
La qualité de cet échantillon de 10 secondes détermine l’essentiel du résultat. Enregistrez dans une pièce calme, sans musique ni bruit de ventilateur, gardez la même distance par rapport au micro du début à la fin et parlez à votre rythme naturel plutôt que de jouer un rôle. Un échantillon propre et neutre l’emporte à chaque fois sur un échantillon énergique et bruyant.
Les clones professionnels reviennent
v3 ne prenait pas en charge les clones vocaux professionnels. v4 les prend en charge, pour des travaux à la plus haute fidélité : un narrateur dont la voix clonée lira des centaines d’heures d’audio.
Chaque clone exige le consentement vérifié du propriétaire de la voix. Ce n’est pas une note en bas de page. Si vous clonez une voix pour un client, obtenez l’autorisation par écrit avant d’importer ne serait-ce qu’une seconde d’audio.
Ce qui change pour les développeurs d’API
Identifiants de modèle et limites
Changer de modèle ne demande qu’une modification de champ. Selon la documentation d’ElevenLabs, le corps de la requête garde la même forme et seul model_id change :
{
"text": "[laughs] That is not what the invoice said.",
"model_id": "eleven_v4"
}
Utilisez eleven_v4_turbo pour la version à faible latence. La limite par requête est de 10 000 caractères, ce qu’ElevenLabs assimile à environ dix minutes d’audio, soit le double des 5 000 caractères autorisés pour eleven_v3. La sortie se fait en MP3, WAV/PCM ou µ-law, et le streaming bidirectionnel via WebSocket est pris en charge, ce qui compte si votre texte arrive token par token depuis un grand modèle de langage.
Les anciens modèles restent disponibles. Selon la documentation, eleven_flash_v2_5 gère 40 000 caractères par requête dans 32 langues, à environ 75 ms, et eleven_multilingual_v2 prend en charge 29 langues. Vous pouvez toujours accéder aux deux sur PicassoIA via Flash v2.5 et v2 Multilingual.
Latence et streaming
Turbo est le point fort ici. ElevenLabs annonce un temps médian avant la première parole d’environ 150 ms et une latence d’inférence médiane d’environ 100 ms. The Decoder compare cela aux 262 ms de Cartesia Sonic 3.6.
Pour les agents vocaux, l’argument le plus intéressant concerne le timing. Le modèle peut commencer à produire de l’audio dès que le grand modèle de langage qui le sous-tend commence à produire sa réponse, si bien que l’interlocuteur entend la réponse pendant que le reste est encore en cours de rédaction.
Deux réserves. ElevenLabs n’a pas publié de chiffre de latence pour v4 standard, et aucun test de latence indépendant n’est encore paru. Mesurez depuis votre propre région, avec votre propre surcharge réseau, car tous les chiffres des fournisseurs l’excluent.
Tarifs et échéance du 12 octobre
Le prix catalogue par million de caractères est de 80 $ pour v4 et de 40 $ pour v4 Turbo. Jusqu’au 12 octobre 2026, l’offre de lancement ramène ces prix à 22 $ et 11 $. Voici ce que coûtent 100 000 caractères, soit environ 100 minutes de parole, dans chaque cas :
Modèle
Prix catalogue
Prix de lancement
100 000 caractères au prix catalogue
100 000 caractères au prix de lancement
Eleven v4
80 $ par million
22 $ par million
8,00 $
2,20 $
Eleven v4 Turbo
40 $ par million
11 $ par million
4,00 $
1,10 $
Si vous évaluez, la remise vous permet de comparer les modèles sur de vrais tests à moindre coût. Si vous établissez le budget d’un produit, fondez vos calculs sur le prix catalogue, car c’est ce que vous paierez une fois l’offre terminée.
Quel modèle pour quel usage
Le bon choix dépend de l’usage de l’audio, et non du modèle le plus récent.
Usage
Meilleur choix
Pourquoi
Livre audio ou longue narration
Eleven v4
Cohérence de la voix et limite de 10 000 caractères
Une répartition pratique pour les petites équipes : rédigez les brouillons sur un modèle plus rapide et moins cher tant que le script change encore, puis générez l’audio final avec le modèle expressif. Le travail vocal devient coûteux lorsqu’on régénère un chapitre entier après chaque modification ; figez donc les mots d’abord et réservez les caractères premium en dernier. Si votre produit combine les deux besoins, par exemple un cours narré avec un assistant de questions-réponses en direct, vous pouvez utiliser v4 pour les leçons et Turbo pour l’assistant, puisque les deux partagent le même format de requête.
3 erreurs courantes
Juger sur une seule phrase. Une ligne de démonstration ne prouve rien sur un chapitre de 40 paragraphes. Testez votre script le plus long et le plus délicat.
Utiliser le modèle expressif pour un agent en direct. Si un interlocuteur attend, Turbo est le bon outil, même si v4 sonne un peu plus riche.
Budgéter au prix de lancement. La remise prend fin le 12 octobre 2026. Chiffrez votre projet à 80 $ et 40 $ par million de caractères.
Comment utiliser ElevenLabs v3 sur PicassoIA
Au moment de la rédaction, v4 ne figure pas dans le catalogue de PicassoIA. ElevenLabs v3 y est disponible, et c’est son plus proche parent : même famille, même façon de suivre les indications intégrées au texte. C’est donc un bon point de départ pour rédiger vos scripts et tester les voix, en attendant que v4 arrive sur d’autres plateformes.
Choisissez une voix parmi les 26 options. La voix par défaut est Rachel ; parmi les autres figurent Aria, Roger, Sarah et James.
Définissez le code de langue, par exemple en, es ou fr.
Laissez les curseurs à leurs valeurs par défaut pour le premier essai, puis lancez la génération et écoutez.
Modifiez un seul réglage à la fois et relancez la génération. Changer trois choses d’un coup ne vous apprend rien.
Les réglages qui comptent
Réglage
Plage
Valeur par défaut
Ce qu’il fait
Vitesse
0,25 à 4,0
1
Rythme de l’ensemble de la lecture
Style
0,0 à 1,0
0
Fait passer le ton de neutre à théâtral
Stabilité
0,0 à 1,0
0,5
Plus la valeur est élevée, plus la voix reste stable sur un long script
Renforcement de similarité
0,0 à 1,0
0,75
Degré de fidélité de la sortie à la voix choisie
Texte précédent / Texte suivant
Texte
Vide
Fournit au modèle le contexte pour que l’intonation s’aligne aux limites des phrases
Deux habitudes vous feront gagner du temps. D’abord, collez le paragraphe qui précède et celui qui suit le vôtre dans les champs de contexte, pour que chaque segment généré se raccorde proprement à ses voisins. Ensuite, essayez des balises entre crochets comme [whispers] dans le prompt et écoutez comment le modèle les traite. C’est le même style de direction autour duquel v4 est conçu, donc cette pratique se transpose à v4.
Un modèle vocal travaille rarement seul. La plupart des projets qui nécessitent une narration ont aussi besoin d’une bande musicale, d’une transcription ou d’une version traduite. Les trois sont disponibles sur PicassoIA.
Composer avec ElevenLabs Music
ElevenLabs Music transforme un prompt textuel en chanson. Pour une narration, demandez quelque chose d’instrumental, de stable et de discret dans le mix. Décrivez l’ambiance, le tempo et les instruments en termes simples, par exemple « guitare acoustique lente, pièce chaleureuse, sans voix, 70 BPM ». Si vous voulez comparer, Lyria 3 Pro et Music 2.6 acceptent le même type de prompt.
Transcrire avec GPT-4o ou Gemini
Une fois la narration produite, il vous faut des sous-titres et une trace écrite. GPT-4o Transcribe convertit l’audio en texte, et GPT-4o Mini Transcribe est l’option plus légère pour des brouillons rapides. Gemini 3 Pro est une troisième voie, utile pour comparer la façon dont chaque modèle gère les noms et les nombres.
Une astuce utile : transcrivez votre narration générée et comparez-la au script d’origine. Tout décalage signale un mot sur lequel la voix a trébuché, que vous pouvez corriger avec une graphie modifiée ou une indication de prononciation.
Doubler des vidéos en plus de 90 langues
ElevenLabs Dubbing prend une vidéo finie et produit des versions dans d’autres langues. Il s’associe naturellement à la liste de langues élargie de v4, car la localisation est le domaine où la cohérence vocale rapporte le plus.
À vous d’expérimenter
La meilleure façon de juger un modèle vocal est de lui donner votre script et d’écouter. Vous n’avez besoin ni de studio, ni de budget dédié, ni d’une semaine de préparation pour commencer.
Voici un plan pour un après-midi :
Rédigez un script de 150 mots avec un revirement émotionnel au milieu.
Générez le rendu sur ElevenLabs v3 avec trois voix différentes et une modification du curseur de style.
Transcrivez le résultat avec GPT-4o Transcribe et vérifiez les mots par rapport à votre script.
Quand v4 arrivera sur la plateforme de votre choix, vous saurez déjà quelles balises, quelles voix et quels réglages conviennent à votre matière, et vous pourrez établir votre budget à partir des prix catalogue en toute confiance.
Ouvrez PicassoIA et essayez votre premier script dès aujourd’hui. Choisissez une voix, ajoutez une balise cumulée et entendez la différence que fait la direction vocale.