Stability AI a lancé Stable Audio 3 le 20 mai 2026, et la première question que tout le monde se pose est de savoir si elle remplace la version 2.5. Ce n’est pas le cas. Les deux modèles ont désormais des rôles différents. La nouvelle famille apporte des poids ouverts que vous pouvez faire tourner sur votre propre matériel, des morceaux qui dépassent six minutes, et des outils d’édition comme l’inpainting. Stable Audio 2.5 reste le moyen le plus rapide, sans aucune configuration, d’obtenir un instrumental propre en moins d’une minute. Vous trouverez ci-dessous les caractéristiques côte à côte, la licence et le coût de l’API en chiffres concrets, des conseils de prompt qui fonctionnent avec les deux, et un guide pour utiliser 2.5 sur PicassoIA dès aujourd’hui.

Stable Audio 3 en un coup d’œil
Stable Audio 3 n’est pas un modèle unique. C’est une famille de quatre modèles reposant sur une nouvelle architecture : un autoencodeur sémantique-acoustique qui compresse l’audio environ 4096 fois et permet de générer n’importe quelle durée, à la seconde près. Trois des quatre modèles sont publiés en poids ouverts sur Hugging Face. Le plus grand n’est accessible que par l’API.
Les quatre modèles
| Modèle | Paramètres | Durée max | Accès |
|---|
| Small SFX | 459 millions | Environ 2 minutes | Poids ouverts |
| Small (musique) | 459 millions | Environ 2 minutes | Poids ouverts |
| Medium | 1,4 milliard | 6 min 20 s | Poids ouverts |
| Large | 2,7 milliards | Plus de 6 minutes | API ou hébergement entreprise |
Les quatre modèles acceptent un prompt textuel. La famille gère aussi l’audio-vers-audio, qui remodèle un extrait existant tout en conservant son timing, et l’inpainting, qui régénère une portion d’un morceau pendant que le reste reste intact. L’inpainting existe en trois variantes : un segment unique, plusieurs segments à la fois, et la continuation causale qui prolonge un morceau à partir de sa fin. Small et Medium acceptent le fine-tuning par LoRA, et la prise en charge par ComfyUI était disponible dès le jour du lancement.

💡 À savoir : aucun des quatre modèles ne chante. Il n’y a ni voix ni paroles dans toute la famille. Si un morceau a besoin d’une voix, vous l’ajoutez avec un autre modèle, et les dernières sections montrent comment faire.
Ce qui a changé depuis la 2.5
Stable Audio 2.5 plafonne à 190 secondes par génération, soit environ trois minutes. Stable Audio 3 Medium double cette durée, avec 6 minutes 20 secondes. L’entraînement est aussi plus propre : le jeu de données est annoncé à environ 1,28 million d’enregistrements sous licence, dont environ 806 000 morceaux provenant d’AudioSparx et environ 473 000 fichiers Creative Commons issus de Freesound. Les contenus protégés par le droit d’auteur ont été écartés, ce qui compte si vous prévoyez de publier ce que vous générez.
Les caractéristiques côte à côte
Voici la version courte dans un seul tableau. Les prix et les durées proviennent des annonces de lancement publiques et de la page du modèle sur PicassoIA, donc vérifiez la page officielle des tarifs avant de budgétiser un projet important.
| Caractéristique | Stable Audio 2.5 | Stable Audio 3 |
|---|
| Durée max | 190 secondes | 6 min 20 s (Medium) |
| Poids | Hébergés uniquement | Ouverts pour Small SFX, Small, Medium |
| Exécution sur votre machine | Non | Small sur CPU, Medium sur GPU |
| Voix | Axé sur l’instrumental | Aucune |
| Prix API par génération | Environ 0,20 $ (20 crédits) | 0,26 $ (26 crédits) |
| Outils d’édition | Prompt textuel sur PicassoIA | Texte, audio-vers-audio, inpainting, continuation |
| Fine-tuning | Non | LoRA sur Small et Medium |
| Configuration | Aucune, fonctionne dans le navigateur | Télécharger les poids ou appeler l’API |

Là où la 2.5 l’emporte encore
Vitesse et simplicité. Les exemples de la page Stable Audio 2.5 ont produit des morceaux de 90 secondes en environ six secondes chacun, avec le réglage par défaut de 8 étapes. Vous ouvrez une page, tapez un prompt, appuyez sur générer. Pas d’environnement Python, pas de pilotes GPU, pas de formulaire de licence.
Prix par génération. À environ 20 crédits contre 26, la 2.5 est l’appel API le moins cher lorsqu’une simple boucle suffit.
Itération prévisible. Réutilisez un seed et vous retrouvez le même audio, ce qui vous permet de changer un seul mot du prompt et d’entendre exactement ce que ce mot a changé.
Là où la 3 prend de l’avance
La durée. Un morceau Medium de six minutes suffit pour une musique de court-métrage ou un fond sonore pour podcast, sans assembler plusieurs clips.
Le contrôle. L’inpainting vous permet de corriger la mesure 40 sans regénérer tout le morceau. La continuation prolonge un morceau à partir de son point d’arrêt. L’audio-vers-audio remodèle un clip que vous avez déjà.
La maîtrise du flux de travail. Les poids ouverts vous permettent de travailler hors ligne, de garder les contenus inédits à l’écart des serveurs tiers et de faire un fine-tuning par LoRA sur votre propre bibliothèque sonore. Un studio de jeux vidéo, par exemple, peut entraîner Small SFX sur ses propres enregistrements de bruitages afin que chaque pas corresponde à l’identité sonore de la maison.
Un contrôle de qualité honnête. Une critique a attribué 7,8 sur 10 à la famille et en a cité les points forts : nappes ambiantes, bruitages, effets sonores, boucles instrumentales et fonds atmosphériques. La même critique notait que la musique peut paraître correcte sans être intéressante, et que les genres rythmés ont tendance à s’aplatir. Considérez la 3 comme un excellent outil pour les fonds et les effets, et non comme un remplacement pour un groupe.
Poids ouverts : ce que vous pouvez faire tourner
Les poids ouverts changent qui peut utiliser ces modèles. Auparavant, les modèles audio de ce niveau étaient derrière une API. Aujourd’hui, un ordinateur portable et un téléchargement suffisent pour les deux petits modèles.

Les petits modèles sur CPU
Small SFX et Small tournent sur un CPU, sans carte graphique dédiée. Les annonces de lancement font état de temps de génération inférieurs à une demi-seconde sur un GPU serveur H200, et l’objectif de la conception est la composition musicale complète sur l’appareil, hors ligne, sans les limites de courts extraits des anciens modèles ouverts. Utilisez Small SFX pour les impacts, les ambiances, les pas et les whooshs. Utilisez Small pour les boucles et les courtes pièces instrumentales allant jusqu’à deux minutes.
Les deux petits modèles acceptent aussi le fine-tuning par LoRA. Une LoRA est un petit module complémentaire entraîné sur vos propres clips, comme les enregistrements de batterie de votre groupe ou la bibliothèque de bruitages d’un jeu, et il oriente chaque génération vers ce caractère. Comme le module complémentaire est minuscule, la tâche est bien plus légère qu’un réentraînement complet du modèle.
Medium est l’option la plus lourde, avec 1,4 milliard de paramètres. Les notes d’installation indiquent qu’un GPU CUDA avec Flash Attention 2 est la configuration prise en charge, et la vitesse annoncée sur un H200 est inférieure à deux secondes par morceau. Un testeur a mesuré quelques secondes sur un MacBook Pro M4, donc vérifiez le dépôt pour votre matériel exact avant de planifier quoi que ce soit.
Les règles de licence en termes simples
Les modèles ouverts utilisent la Stability AI Community License.
- Moins de 1 million de dollars de chiffre d’affaires annuel : téléchargement, exécution, fine-tuning et usage commercial gratuits une fois que vous vous êtes inscrit à la Community License. Vous possédez vos productions, dans la limite de ce que la loi autorise.
- Plus de 1 million de dollars : vous avez besoin d’une Enterprise License, qui ajoute aussi une garantie d’indemnisation juridique.
- Large : jamais téléchargeable. On y accède via l’API Stability, via fal.ai, ou via un hébergement entreprise.

💡 À lire avant de publier : « vous possédez la production » ne signifie pas « la production est protégée par le droit d’auteur ». Dans de nombreux pays, un audio purement généré par une machine bénéficie d’une protection plus faible qu’une œuvre humaine. Si un morceau est au cœur de votre marque, ajoutez votre propre interprétation ou vos propres retouches.
Utiliser l’API
Tout le monde n’a pas envie d’installer quoi que ce soit. La voie hébergée est le chemin le plus court entre l’idée et le fichier.

Le coût par génération
Stability facture en crédits, et un crédit vaut un centime. Une génération Stable Audio 3 coûte 26 crédits, soit 0,26 $. Stable Audio 2.5 est annoncée à 20 crédits, soit environ 0,20 $. Petit piège : le solde gratuit de départ, de 25 crédits, est d’un crédit inférieur au coût d’une seule exécution Stable Audio 3, donc prévoyez une petite recharge même pour les tests.
| Volume | À 0,26 $ par génération | À 0,20 $ par génération |
|---|
| 10 morceaux | 2,60 $ | 2,00 $ |
| 100 morceaux | 26,00 $ | 20,00 $ |
| 1 000 morceaux | 260,00 $ | 200,00 $ |
Quand l’API l’emporte sur le local
Choisissez l’API lorsque vous avez besoin du modèle Large, car c’est la seule façon de l’atteindre sans contrat entreprise. Choisissez-la aussi quand vous n’avez pas de GPU, quand votre volume est irrégulier, ou lorsqu’un produit a besoin d’audio à la demande sans que vous ayez à maintenir des serveurs. Choisissez les poids en local lorsque vous générez des milliers de clips, travaillez hors ligne ou devez faire du fine-tuning.
Un flux de travail hébergé typique se présente ainsi :
- Rédigez le prompt avec le genre, les instruments, l’ambiance et le tempo.
- Réglez la durée souhaitée, en secondes entières.
- Envoyez la requête et attendez le fichier audio.
- Écoutez, puis modifiez une variable et relancez.
- Découpez, fondez et bouclez le meilleur résultat dans votre éditeur.
Le schéma hébergé de Stable Audio 2.5 est simple : un prompt textuel, une durée, un nombre d’étapes, une échelle CFG et un seed facultatif. Ce sont les mêmes réglages que vous rencontrerez sur la plupart des points d’accès Stable Audio, donc ce que vous pratiquez avec la 2.5 vous servira ailleurs.
Conseils de prompt qui fonctionnent
Les prompts pour les deux versions récompensent la précision. Une demande vague comme « musique relaxante » donne un fond sonore générique. Un prompt qui précise le genre, les instruments, l’ambiance et le tempo donne un résultat exploitable.

La formule en cinq parties
Rédigez vos prompts dans cet ordre, séparés par des virgules :
- Genre : boom bap hip hop, ambient house, post-rock, synthwave cinématographique
- Instruments : piano solennel, batterie SP-1200, grosse caisse 808, cordes, basse sinusoïdale
- Ambiance : paisible, euphorique, mélancolique, tendue
- Tempo : un nombre, comme 90 BPM ou 125 BPM
- Texture ou échelle : chaleureux, poussiéreux, ample, tonalité mineure
| Prompt faible | Prompt efficace |
|---|
| Musique relaxante | Instrumental boom bap hip hop soulful, piano solennel, batterie SP-1200, basse sinusoïdale, paisible, 90 BPM |
| Morceau de danse | Ambient house, boîte à rythmes 808, claps, shaker, basse synthé, euphorique, 125 BPM |
| Musique de film épique | Post-rock, guitares, batterie, basse, cordes, inspirant, fluide, sentimental, 125 BPM |
| Bruit de porte | Claquement de lourde porte en bois dans un hall de pierre, longue traîne d’écho, sans musique |
Pour les morceaux plus longs, ajoutez des indications de timing à la fin du prompt : « nappes douces pendant les 20 premières secondes, la batterie entre après 20 secondes, fondu lent à la fin. » Les longs morceaux Stable Audio 3 en bénéficient le plus, car une pièce de six minutes a besoin d’un arc. Avec la 2.5, gardez les indications de timing courtes et jugez le résultat à l’oreille.
Pour les effets sonores, remplacez la formule musicale par trois détails : l’objet, la surface qu’il touche, et l’espace autour. « Bottes sur gravier mouillé, carrière vide, vent lointain » l’emporte généralement sur « pas », car le modèle peut placer le son dans une pièce.
💡 Raccourci : deux ou trois mots peuvent aussi suffire. De courts prompts de genre comme « Lo-fi Funk » ou « Cinematic Synthwave » ont donné des morceaux de 90 secondes exploitables dans les exemples de la 2.5. N’ajoutez de détails que lorsque le premier résultat s’éloigne de ce que vous voulez.
Les erreurs qui font perdre des crédits
- Demander des voix. Stable Audio 3 n’a ni voix ni paroles, et la 2.5 vise les instrumentaux et le sound design. Utilisez un modèle de chant pour interpréter des paroles.
- Empiler les adjectifs. Dix mots d’ambiance s’annulent. Choisissez-en deux.
- Oublier le tempo. Sans BPM, le rythme dérive. Un nombre le stabilise.
- Relancer au hasard. Modifiez une seule chose à la fois et gardez le seed fixe, afin de savoir quelle modification a aidé.
- Attendre un refrain à succès. Ces modèles sont meilleurs pour les fonds, les boucles, les ambiances et les effets.
Corriger les transitions faibles
La musique générée peut présenter des transitions faibles, des répétitions, un rythme instable, du bruit de fond et des fins abruptes. Avec Stable Audio 3, corrigez la section défaillante par inpainting au lieu de tout recommencer. Avec la 2.5, générez un peu plus long que nécessaire, coupez la fin faible dans n’importe quel éditeur audio et ajoutez un court fondu.
Au moment de la rédaction, le catalogue de PicassoIA propose Stable Audio 2.5, et non Stable Audio 3. C’est toujours le moyen le plus rapide de tester un style de prompt sans rien installer, et les habitudes se transposent.

Étape par étape
- Ouvrez la page Stable Audio 2.5 sur PicassoIA.
- Collez un prompt construit avec la formule en cinq parties ci-dessus.
- Réglez la durée en secondes. La valeur par défaut est 190, le maximum.
- Laissez steps à 8 pour un premier passage rapide.
- Laissez CFG scale à 1, puis augmentez-la si le résultat ignore vos instruments.
- Appuyez sur générer et écoutez. La plupart des morceaux de 90 secondes se terminent en six secondes environ.
- Copiez le seed qui vous plaît, changez un mot du prompt et relancez la génération.
Réglages à modifier
| Réglage | Valeur par défaut | Ce qu’il fait |
|---|
| Prompt | Aucun | Décrit le genre, les instruments, l’ambiance et le tempo |
| Durée | 190 | Longueur du morceau en secondes |
| Steps | 8 | Plus d’étapes échangent la vitesse contre plus de détails |
| CFG scale | 1 | Des valeurs plus élevées suivent le prompt de plus près |
| Seed | Aléatoire | Réutilisez-le pour reproduire un résultat |
Commencez par des durées courtes. Une boucle de 30 secondes prend le moins de temps à juger, et vous pourrez ensuite prolonger un prompt gagnant jusqu’à la durée complète.
Ajouter voix, voix off et transcriptions
Comme aucune des deux versions ne chante, un projet fini a généralement besoin de deux ou trois outils. PicassoIA les regroupe au même endroit.

Chansons avec voix
Lorsque le brief demande des paroles et un chanteur, changez de modèle. Music 2.5 génère des chansons complètes avec voix. Lyria 3 Pro crée des chansons de pleine longueur, et Music from ElevenLabs compose des morceaux à partir d’un prompt textuel. Un flux de travail courant consiste à esquisser la base instrumentale dans Stable Audio, puis à la comparer avec un modèle vocal pour voir lequel convient à la vidéo.
Voix off et transcriptions
Pour une narration sur votre instrumental, Speech 2.8 HD produit des voix off de qualité studio, Gemini 3.1 Flash TTS propose 30 voix dans plus de 70 langues, et V3 from ElevenLabs est une option au rendu naturel pour les lectures plus longues.
Pour retranscrire des enregistrements en texte, passez-les par GPT 4o Transcribe ou Gemini 3 Pro. Les transcriptions aident pour les sous-titres, les notes d’émission et pour vérifier qu’une voix off dit exactement ce que dit le script avant de passer sous la musique.
Créez votre premier morceau dès aujourd’hui
Alors, lequel choisir ? Cela dépend de la tâche :
| Tâche | Meilleur choix | Pourquoi |
|---|
| Pas, impacts et pack d’ambiances | Stable Audio 3 Small SFX | Gratuit, hors ligne, fonctionne sur CPU |
| Boucle pour une vidéo ou un reel | Stable Audio 3 Small ou Stable Audio 2.5 | Rapide et peu coûteux, et la 2.5 ne demande aucune configuration |
| Fond sonore de six minutes | Stable Audio 3 Medium | Le plus long modèle ouvert, nécessite un GPU |
| Audio à la demande dans un produit | Stable Audio 3 Large (API) | Haut de gamme, aucun serveur à maintenir |
| Test rapide d’une idée de prompt | Stable Audio 2.5 sur PicassoIA | Résultats en quelques secondes, rien à installer |
La meilleure façon d’entendre la différence entre les prompts est de les essayer. Ouvrez Stable Audio 2.5 sur PicassoIA, collez l’un des prompts du tableau ci-dessus et générez une boucle de 30 secondes. Puis changez le tempo, remplacez un instrument et réécoutez. En dix minutes, vous aurez une idée de la façon dont cette famille réagit, et lorsque vous serez prêt pour les voix ou les transcriptions, les modèles de parole et de transcription sont à un clic sur la même plateforme.