Stable Audio 3 ou 2.5: modelos abertos, API e dicas de prompt

O Stable Audio 3 traz pesos abertos, faixas de seis minutos e inpainting, enquanto o Stable Audio 2.5 continua sendo a opção rápida, sem configuração. Veja as especificações lado a lado, o que a Community License permite, quanto a API custa por faixa e a fórmula de prompt que gera músicas mais limpas nos dois.

Stable Audio 3 ou 2.5: modelos abertos, API e dicas de prompt
Cristian Da Conceicao
Fundador do Picasso IA

A Stability AI lançou o Stable Audio 3 em 20 de maio de 2026, e a primeira pergunta de todo mundo é se ele aposenta a versão 2.5. Não aposenta. Hoje as duas fazem trabalhos diferentes. A nova família traz pesos abertos que você pode rodar no seu próprio hardware, faixas que passam de seis minutos e ferramentas de edição como o inpainting. O Stable Audio 2.5 continua sendo a forma mais rápida, sem nenhuma configuração, de conseguir um instrumental limpo em menos de um minuto. Abaixo você encontra as especificações lado a lado, a licença e o custo da API em números simples, dicas de prompt que funcionam nas duas versões e um passo a passo para usar o 2.5 no PicassoIA hoje.

Vista de cima de uma mesa de carvalho com um notebook, fones de ouvido, um caderno e um controlador MIDI

Stable Audio 3 em resumo

O Stable Audio 3 não é um único modelo. É uma família de quatro, construída sobre uma arquitetura nova: um autoencoder semântico-acústico que comprime o áudio cerca de 4096 vezes e permite gerar qualquer duração, até o segundo. Três dos quatro são disponibilizados como pesos abertos no Hugging Face. O maior deles é somente via API.

Os quatro modelos

ModeloParâmetrosDuração máximaAcesso
Small SFX459 milhõesCerca de 2 minutosPesos abertos
Small (música)459 milhõesCerca de 2 minutosPesos abertos
Medium1,4 bilhão6 min 20 sPesos abertos
Large2,7 bilhõesMais de 6 minutosAPI ou hospedagem corporativa

Os quatro aceitam um prompt de texto. A família também faz audio-to-audio, que remodela um clipe existente mantendo seu tempo, e inpainting, que regenera um trecho de uma faixa enquanto o resto fica intacto. O inpainting vem em três formas: um único segmento, vários segmentos de uma vez e continuação causal, que estende uma faixa a partir do ponto em que ela termina. Small e Medium aceitam fine-tuning com LoRA, e o suporte ao ComfyUI chegou no dia do lançamento.

Quatro microfones de condensador de tamanhos crescentes alinhados sobre uma mesa de madeira

💡 Vale saber: nenhum dos quatro modelos canta. Não há vocais nem letras em lugar nenhum da família. Se uma faixa precisar de voz, você a adiciona com um modelo separado, e as últimas seções mostram como.

O que mudou desde o 2.5

O Stable Audio 2.5 chega a 190 segundos por geração, cerca de três minutos. O Stable Audio 3 Medium dobra esse limite, com 6 min 20 s. O treinamento também ficou mais criterioso: o conjunto de dados é relatado com cerca de 1,28 milhão de gravações licenciadas, aproximadamente 806.000 faixas da AudioSparx e cerca de 473.000 arquivos Creative Commons do Freesound. Material protegido por direitos autorais foi filtrado, o que importa se você pretende publicar o que gerar.

Especificações lado a lado

Aqui está a versão curta, em uma tabela. Preços e durações vêm de relatórios públicos de lançamento e da página do modelo no PicassoIA, então confira a página oficial de preços antes de orçar um projeto grande.

RecursoStable Audio 2.5Stable Audio 3
Duração máxima190 segundos6 min 20 s (Medium)
PesosSomente hospedadosAbertos para Small SFX, Small, Medium
Rodar na sua máquinaNãoSmall na CPU, Medium na GPU
VocaisFoco em instrumentalNenhum
Preço da API por execuçãoCerca de US$ 0,20 (20 créditos)US$ 0,26 (26 créditos)
Ferramentas de ediçãoPrompt de texto no PicassoIATexto, audio-to-audio, inpainting, continuação
Fine-tuningNãoLoRA em Small e Medium
ConfiguraçãoNenhuma, roda no navegadorBaixar os pesos ou chamar a API

Dois monitores de estúdio pretos voltados para a câmera em uma sala tratada acusticamente

Onde o 2.5 ainda vence

Velocidade e simplicidade. Os exemplos da página do Stable Audio 2.5 geraram faixas de 90 segundos em cerca de seis segundos cada, com os 8 passos padrão. Você abre a página, digita um prompt e clica em gerar. Sem ambiente Python, sem drivers de GPU, sem formulário de licença.

Preço por execução. Com cerca de 20 créditos contra 26, o 2.5 é a chamada de API mais barata quando um loop curto é tudo de que você precisa.

Iteração previsível. Reutilize um seed e você recebe o mesmo áudio de volta, então pode trocar uma palavra do prompt e ouvir exatamente o que aquela palavra fez.

Onde o 3 se destaca

Duração. Uma faixa de seis minutos do Medium basta para um cue de curta-metragem ou uma base para podcast, sem precisar juntar clipes.

Controle. O inpainting permite corrigir o compasso 40 sem gerar a música inteira de novo. A continuação estende uma faixa a partir do ponto em que ela para. O audio-to-audio remodela um clipe que você já tem.

Controle do fluxo de trabalho. Pesos abertos significam que você pode rodar offline, manter material inédito fora de servidores de terceiros e fazer fine-tuning com LoRA na sua própria biblioteca de sons. Um estúdio de games, por exemplo, pode treinar o Small SFX com suas próprias gravações de foley para que cada passo combine com o estilo da casa.

Verificação honesta de qualidade. Uma avaliação deu 7,8 de 10 para a família e citou os pontos fortes: drones ambientais, foley, efeitos sonoros, loops instrumentais e camas atmosféricas. A mesma avaliação observou que a música pode parecer correta sem parecer interessante, e que gêneros rítmicos tendem a ficar achatados. Trate o 3 como uma ferramenta forte para camas e efeitos, não como substituto de uma banda.

Pesos abertos: o que você pode rodar

Pesos abertos mudam quem pode usar isso. Antes, modelos de áudio nesse nível de qualidade ficavam atrás de uma API. Agora um notebook e um download bastam para os dois modelos pequenos.

Um homem ouvindo com fones de ouvido in-ear, com um notebook em uma sala ensolarada

Modelos pequenos na CPU

Small SFX e Small rodam na CPU, sem placa de vídeo dedicada. Os relatórios de lançamento indicam tempos de geração abaixo de meio segundo em uma GPU de servidor H200, e a proposta do design é a composição musical completa no próprio dispositivo, offline, sem os limites de amostras curtas dos modelos abertos mais antigos. Use o Small SFX para impactos, ambiências, passos e sons de swoosh. Use o Small para loops e peças instrumentais curtas de até dois minutos.

Os dois modelos pequenos também aceitam fine-tuning com LoRA. Um LoRA é um complemento pequeno treinado com seus próprios clipes, como as gravações de bateria da sua banda ou a biblioteca de foley de um jogo, e ele puxa cada geração na direção desse caráter. Como o complemento é minúsculo, o trabalho é bem mais leve do que retreinar um modelo completo.

O Medium é a opção mais pesada, com 1,4 bilhão de parâmetros. As notas de configuração indicam uma GPU CUDA com Flash Attention 2 como caminho suportado, e a velocidade relatada em um H200 é de menos de dois segundos por faixa. Um revisor mediu alguns segundos em um MacBook Pro M4, então verifique o repositório para o seu hardware exato antes de planejar com base nisso.

Regras de licença em linguagem simples

Os modelos abertos usam a Stability AI Community License.

  • Receita anual abaixo de US$ 1 milhão: gratuito para baixar, rodar, fazer fine-tuning e usar comercialmente, depois de se registrar na Community License. Você é dono das suas saídas, na medida em que a lei permitir.
  • Acima de US$ 1 milhão: você precisa de uma Enterprise License, que também inclui indenização jurídica.
  • Large: nunca disponível para download. Ele é acessível pela API da Stability, pela fal.ai ou por hospedagem corporativa própria.

Duas mãos assinando um acordo impresso ao lado de uma interface de áudio

💡 Leia antes de publicar: "você é dono da saída" não é o mesmo que "a saída é protegida por direitos autorais". Em muitos países, áudio puramente produzido por máquina tem proteção mais fraca do que obras humanas. Se uma faixa for central para a sua marca, adicione sua própria interpretação ou edições por cima.

Usando a API

Nem todo mundo quer instalar nada. A via hospedada é o caminho mais curto da ideia ao arquivo.

Um desenvolvedor digitando em uma mesa em pé, com fones de estúdio no pescoço

Custo por geração

A Stability cobra em créditos, e um crédito equivale a um centavo de dólar. Uma geração do Stable Audio 3 custa 26 créditos, ou US$ 0,26. O Stable Audio 2.5 é relatado com 20 créditos, cerca de US$ 0,20. Uma pegadinha: o saldo inicial gratuito de 25 créditos fica um crédito abaixo de uma única execução do Stable Audio 3, então reserve uma pequena recarga mesmo para testes.

VolumeA US$ 0,26 por execuçãoA US$ 0,20 por execução
10 faixasUS$ 2,60US$ 2,00
100 faixasUS$ 26,00US$ 20,00
1.000 faixasUS$ 260,00US$ 200,00

Quando a API vence a execução local

Escolha a API quando precisar do modelo Large, porque é a única forma de acessá-lo sem um contrato corporativo. Escolha-a também quando não tiver GPU, quando seu volume for irregular ou quando um produto precisar de áudio sob demanda sem que você mantenha servidores. Escolha os pesos locais quando gerar milhares de clipes, trabalhar offline ou precisar de fine-tuning.

Um fluxo típico na nuvem fica assim:

  1. Escreva o prompt com gênero, instrumentos, clima e andamento.
  2. Defina a duração que você precisa, em segundos inteiros.
  3. Envie a requisição e espere o arquivo de áudio.
  4. Ouça, depois mude uma variável e gere de novo.
  5. Corte, aplique fade e faça o loop da melhor versão no seu editor.

O esquema hospedado do Stable Audio 2.5 é simples: um prompt de texto, uma duração, um número de passos, uma escala CFG e um seed opcional. São os mesmos controles que você vai encontrar na maioria dos endpoints do Stable Audio, então o que você praticar no 2.5 vale para os outros.

Dicas de prompt que funcionam

Os prompts das duas versões recompensam especificidade. Um pedido vago como "música relaxante" devolve papel de parede genérico. Um prompt que nomeia gênero, instrumentos, clima e andamento devolve algo que você pode usar.

Uma mão escrevendo em um caderno ao lado de um pequeno sintetizador analógico

A fórmula das cinco partes

Escreva os prompts nesta ordem, separados por vírgulas:

  1. Gênero: boom bap hip hop, ambient house, post-rock, synthwave cinematográfico
  2. Instrumentos: piano solene, bateria SP-1200, bumbo 808, cordas, baixo de onda senoidal
  3. Clima: tranquilo, eufórico, melancólico, tenso
  4. Andamento: um número, como 90 BPM ou 125 BPM
  5. Textura ou escala: quente, empoeirada, ampla, tonalidade menor
Prompt fracoPrompt forte
Música relaxanteInstrumental de boom bap hip hop soulful, piano solene, bateria SP-1200, baixo de onda senoidal, tranquilo, 90 BPM
Faixa para dançarAmbient house, bateria eletrônica 808, palmas, shaker, baixo sintetizado, eufórico, 125 BPM
Música épica de filmePost-rock, guitarras, bateria, baixo, cordas, edificante, fluido, sentimental, 125 BPM
Som de portaBatida forte de porta de madeira em um salão de pedra, cauda longa de eco, sem música

Para faixas mais longas, acrescente marcações de tempo no fim do prompt: "pads suaves nos primeiros 20 segundos, a bateria entra após 20 segundos, fade lento no final." Faixas longas do Stable Audio 3 se beneficiam mais disso, já que uma peça de seis minutos precisa de um arco. No 2.5, mantenha as pistas de tempo curtas e avalie o resultado pelo ouvido.

Para efeitos sonoros, troque a fórmula musical por três detalhes: o objeto, a superfície com que ele entra em contato e o espaço ao redor. "Botas sobre cascalho molhado, pedreira vazia, vento distante" costuma superar "passos", porque o modelo consegue posicionar o som em um ambiente.

💡 Atalho: duas ou três palavras também podem funcionar. Prompts curtos de gênero, como "Lo-fi Funk" ou "Cinematic Synthwave", geraram faixas de 90 segundos utilizáveis nos exemplos do 2.5. Adicione detalhes só quando o primeiro resultado sair do rumo.

Erros que desperdiçam créditos

  • Pedir vocais. O Stable Audio 3 não tem vocais nem letras, e o 2.5 é voltado para instrumentais e design sonoro. Use um modelo de canção para cantar.
  • Acumular adjetivos. Dez palavras de clima se anulam. Escolha duas.
  • Pular o andamento. Sem um BPM, o ritmo se perde. Um número o ancora.
  • Gerar de novo sem critério. Mude uma coisa de cada vez e mantenha o seed fixo, para saber qual edição ajudou.
  • Esperar um refrão de sucesso. Esses modelos vão melhor em camas, loops, ambiências e efeitos.

Corrija transições fracas

A música gerada pode apresentar transições fracas, repetição, ritmo instável, ruído de fundo e finais abruptos. No Stable Audio 3, você corrige o trecho ruim com inpainting em vez de começar do zero. No 2.5, gere um pouco mais do que precisa, corte o final fraco em qualquer editor de áudio e adicione um fade curto.

Use o Stable Audio 2.5 no PicassoIA

No momento em que escrevo, o catálogo do PicassoIA lista o Stable Audio 2.5, e não o Stable Audio 3. Ele continua sendo a forma mais rápida de testar um estilo de prompt sem instalar nada, e os hábitos se transferem.

Vista por cima do ombro de uma mulher com fones de ouvido olhando uma forma de onda em um notebook

Passo a passo

  1. Abra a página do Stable Audio 2.5 no PicassoIA.
  2. Cole um prompt montado com a fórmula das cinco partes acima.
  3. Defina a duração em segundos. O padrão é 190, o máximo.
  4. Deixe os passos em 8 para uma primeira passagem rápida.
  5. Deixe a escala CFG em 1 e suba se o resultado ignorar seus instrumentos.
  6. Clique em gerar e ouça. A maioria das faixas de 90 segundos termina em cerca de seis segundos.
  7. Copie o seed de que você gostou, troque uma palavra do prompt e gere de novo.

Configurações que vale mudar

ConfiguraçãoPadrãoO que faz
PromptNenhumDescreve gênero, instrumentos, clima e andamento
Duração190Tamanho da faixa em segundos
Passos8Mais passos trocam velocidade por detalhe mais nítido
Escala CFG1Valores maiores seguem o prompt com mais fidelidade
SeedAleatórioReutilize para reproduzir um resultado

Comece com durações curtas. Um loop de 30 segundos leva menos tempo para avaliar, e você pode estender depois um prompt vencedor até a duração completa.

Adicione vocais, narrações e transcrições

Como nenhuma das duas versões canta, um projeto finalizado normalmente precisa de duas ou três ferramentas. O PicassoIA reúne todas em um só lugar.

Um cantor de jaqueta jeans diante de um microfone de condensador dentro de uma cabine de voz

Canções com vocais

Quando o briefing pede letra e cantor, troque de modelo. O Music 2.5 gera canções completas com vocais. O Lyria 3 Pro cria canções de duração completa, e a Music from ElevenLabs compõe faixas a partir de um prompt de texto. Um fluxo comum: rascunhe a base instrumental no Stable Audio e compare com um modelo de voz para ver qual combina com o vídeo.

Narrações e transcrições

Para narrar sobre o seu instrumental, o Speech 2.8 HD entrega narrações com qualidade de estúdio, o Gemini 3.1 Flash TTS oferece 30 vozes em mais de 70 idiomas, e a V3 from ElevenLabs é uma opção de som natural para leituras mais longas.

Para transformar gravações de volta em texto, passe-as pelo GPT 4o Transcribe ou pelo Gemini 3 Pro. As transcrições ajudam com legendas, notas do episódio e a conferir se a narração diz exatamente o que o roteiro diz antes de ir por baixo da música.

Faça sua primeira faixa hoje

Então, qual escolher? Depende do trabalho:

TrabalhoMelhor escolhaPor quê
Passos, impactos e pacote de ambiênciasStable Audio 3 Small SFXGratuito, offline, roda na CPU
Loop para um vídeo ou reelStable Audio 3 Small ou Stable Audio 2.5Rápido e barato, e o 2.5 não precisa de configuração
Base de fundo de seis minutosStable Audio 3 MediumModelo aberto mais longo, precisa de GPU
Áudio sob demanda dentro de um produtoStable Audio 3 Large (API)Nível mais alto, sem servidores para manter
Teste rápido de uma ideia de promptStable Audio 2.5 no PicassoIAResultados em segundos, nada para instalar

A forma mais rápida de perceber a diferença nos prompts é testá-los. Abra o Stable Audio 2.5 no PicassoIA, cole um dos prompts da tabela acima e gere um loop de 30 segundos. Depois mude o andamento, troque um instrumento e ouça de novo. Em dez minutos você terá uma noção de como essa família responde, e quando estiver pronto para vozes ou transcrições, os modelos de fala e de transcrição ficam a um clique na mesma plataforma.

Compartilhe este artigo

Escolha seu idioma