Stability AI lanzó Stable Audio 3 el 20 de mayo de 2026, y la primera pregunta de todos es si reemplaza a la versión 2.5. No es así. Ahora las dos cumplen funciones distintas. La nueva familia trae pesos abiertos que puedes ejecutar en tu propio equipo, pistas que superan los seis minutos y herramientas de edición como el inpainting. Stable Audio 2.5 sigue siendo la forma más rápida, sin configuración, de obtener un instrumental limpio en menos de un minuto. A continuación encontrarás las especificaciones lado a lado, la licencia y el costo de la API en cifras claras, consejos de prompt que sirven para ambos y una guía para usar 2.5 en PicassoIA hoy.

Stable Audio 3 de un vistazo
Stable Audio 3 no es un solo modelo. Es una familia de cuatro, construida sobre una arquitectura nueva: un autoencoder semántico-acústico que comprime el audio unas 4096 veces y permite generar cualquier duración, hasta el segundo. Tres de los cuatro se publican como pesos abiertos en Hugging Face. El más grande solo está disponible por API.
Los cuatro modelos
| Modelo | Parámetros | Duración máxima | Acceso |
|---|
| Small SFX | 459 millones | Unos 2 minutos | Pesos abiertos |
| Small (música) | 459 millones | Unos 2 minutos | Pesos abiertos |
| Medium | 1.400 millones | 6 min 20 s | Pesos abiertos |
| Large | 2.700 millones | Más de 6 minutos | API o alojamiento empresarial |
Los cuatro aceptan un prompt de texto. La familia también gestiona audio a audio, que remodela un clip existente manteniendo su ritmo, y inpainting, que regenera un tramo de una pista mientras el resto permanece intacto. El inpainting tiene tres variantes: un solo segmento, varios segmentos a la vez y continuación causal, que extiende una pista desde donde termina. Small y Medium admiten ajuste fino con LoRA, y el soporte para ComfyUI llegó el mismo día del lanzamiento.

💡 Conviene saberlo: ninguno de los cuatro modelos canta. No hay voces ni letras en toda la familia. Si una pista necesita una voz, se añade con un modelo aparte, y las últimas secciones explican cómo.
Qué cambió desde 2.5
Stable Audio 2.5 llega hasta 190 segundos por generación, unos tres minutos. Stable Audio 3 Medium lo duplica, con 6 minutos y 20 segundos. El entrenamiento también se volvió más limpio: según se informa, el conjunto de datos tiene unas 1,28 millones de grabaciones con licencia, unas 806.000 pistas de AudioSparx y unos 473.000 archivos de Creative Commons de Freesound. Se excluyó el material protegido por derechos de autor, lo que importa si piensas publicar lo que generes.
Especificaciones lado a lado
Aquí tienes la versión corta en una sola tabla. Los precios y las duraciones provienen de los informes públicos de lanzamiento y de la página del modelo en PicassoIA, así que consulta la página oficial de precios antes de presupuestar un proyecto grande.
| Característica | Stable Audio 2.5 | Stable Audio 3 |
|---|
| Duración máxima | 190 segundos | 6 min 20 s (Medium) |
| Pesos | Solo alojados | Abiertos para Small SFX, Small, Medium |
| Ejecutar en tu equipo | No | Small en CPU, Medium en GPU |
| Voces | Enfoque instrumental | Ninguna |
| Precio de API por ejecución | Unos $0,20 (20 créditos) | $0,26 (26 créditos) |
| Herramientas de edición | Prompt de texto en PicassoIA | Texto, audio a audio, inpainting, continuación |
| Ajuste fino | No | LoRA en Small y Medium |
| Configuración | Ninguna, funciona en el navegador | Descargar los pesos o llamar a la API |

Dónde gana todavía 2.5
Velocidad y sencillez. Los ejemplos de la página de Stable Audio 2.5 produjeron pistas de 90 segundos en unos seis segundos cada una, con los 8 pasos predeterminados. Abres una página, escribes un prompt y pulsas generar. Sin entorno de Python, sin controladores de GPU y sin formulario de licencia.
Precio por ejecución. Con unos 20 créditos frente a 26, 2.5 es la llamada a la API más barata cuando solo necesitas un bucle corto.
Iteración predecible. Reutiliza una semilla y recuperarás el mismo audio, así que puedes cambiar una palabra del prompt y escuchar exactamente qué hizo.
Dónde se adelanta 3
Duración. Una pista Medium de seis minutos basta para una cue de cortometraje o una base para un podcast, sin unir clips.
Control. El inpainting te permite corregir el compás 40 sin volver a generar toda la canción. La continuación extiende una pista desde donde se detiene. El audio a audio remodela un clip que ya tienes.
Control del flujo de trabajo. Los pesos abiertos permiten trabajar sin conexión, mantener el material inédito fuera de servidores de terceros y hacer ajuste fino con LoRA sobre tu propia biblioteca de sonidos. Un estudio de videojuegos, por ejemplo, puede entrenar Small SFX con sus propias grabaciones de foley para que cada paso encaje con el estilo de la casa.
Revisión honesta de calidad. Una reseña puntuó la familia con 7,8 sobre 10 y señaló sus puntos fuertes: drones ambientales, foley, efectos de sonido, bucles instrumentales y bases atmosféricas. La misma reseña observó que la música puede parecer correcta sin resultar interesante, y que los géneros rítmicos tienden a aplanarse. Considera a 3 una herramienta sólida para bases y efectos, no un sustituto de una banda.
Pesos abiertos: qué puedes ejecutar
Los pesos abiertos cambian quién puede usar esto. Antes, los modelos de audio de esta calidad estaban detrás de una API. Ahora un equipo portátil y una descarga bastan para los dos modelos pequeños.

Modelos pequeños en una CPU
Small SFX y Small se ejecutan en una CPU, sin tarjeta gráfica dedicada. Los informes de lanzamiento sitúan los tiempos de generación por debajo de medio segundo en una GPU de servidor H200, y la intención del diseño es la composición musical completa en el propio dispositivo, sin conexión y sin los límites de muestras cortas que tenían los modelos abiertos anteriores. Usa Small SFX para impactos, ambientes, pasos y sonidos de aire en movimiento. Usa Small para bucles y piezas instrumentales cortas de hasta dos minutos.
Ambos modelos pequeños también admiten ajuste fino con LoRA. Un LoRA es un complemento pequeño entrenado con tus propios clips, como las grabaciones de batería de tu banda o la biblioteca de foley de un videojuego, y empuja cada generación hacia ese carácter. Como el complemento es diminuto, el trabajo es mucho más ligero que reentrenar un modelo completo.
Medium es la opción más pesada, con 1.400 millones de parámetros. Las notas de configuración indican una GPU CUDA con Flash Attention 2 como vía compatible, y la velocidad informada en una H200 es de menos de dos segundos por pista. Un revisor midió unos segundos en un MacBook Pro M4, así que consulta el repositorio para tu hardware exacto antes de planificar en torno a ello.
Las reglas de la licencia en palabras sencillas
Los modelos abiertos usan la Stability AI Community License.
- Menos de 1 millón de dólares de ingresos anuales: gratis para descargar, ejecutar, ajustar y usar comercialmente una vez que te registres en la Community License. Eres dueño de tus resultados, en la medida en que lo permita la ley.
- Más de 1 millón de dólares: necesitas una Enterprise License, que además incluye indemnización legal.
- Large: nunca se descarga. Se accede a través de la API de Stability, de fal.ai o mediante alojamiento empresarial propio.

💡 Léelo antes de publicar: "eres dueño del resultado" no es lo mismo que "el resultado está protegido por derechos de autor". En muchos países, el audio generado íntegramente por una máquina tiene una protección más débil que una obra hecha por personas. Si una pista es central para tu marca, añade tu propia interpretación o tus ediciones encima.
Usar la API
No todo el mundo quiere instalar nada. La ruta alojada es el camino más corto de la idea al archivo.

Costo por generación
Stability cobra en créditos, y un crédito equivale a un centavo. Una generación de Stable Audio 3 cuesta 26 créditos, o $0,26. Stable Audio 2.5 se informa en 20 créditos, unos $0,20. Un detalle a tener en cuenta: el saldo inicial gratuito de 25 créditos es un crédito menos que una sola ejecución de Stable Audio 3, así que presupuesta una pequeña recarga incluso para hacer pruebas.
| Volumen | A $0,26 por ejecución | A $0,20 por ejecución |
|---|
| 10 pistas | $2,60 | $2,00 |
| 100 pistas | $26,00 | $20,00 |
| 1.000 pistas | $260,00 | $200,00 |
Cuándo la API gana a lo local
Elige la API cuando necesites el modelo Large, porque es la única forma de acceder a él sin un contrato empresarial. Elígela también cuando no tengas GPU, cuando tu volumen sea irregular o cuando un producto necesite audio a demanda sin que tú mantengas servidores. Elige los pesos locales cuando generes miles de clips, trabajes sin conexión o necesites ajuste fino.
Un flujo de trabajo típico alojado es así:
- Escribe el prompt con género, instrumentos, estado de ánimo y tempo.
- Fija la duración que necesites, en segundos enteros.
- Envía la solicitud y espera el archivo de audio.
- Escucha, cambia una variable y vuelve a generar.
- Recorta, aplica fundidos y haz bucle con el resultado en tu editor.
El esquema alojado de Stable Audio 2.5 es sencillo: un prompt de texto, una duración, un número de pasos, una escala CFG y una semilla opcional. Son los mismos controles que encontrarás en la mayoría de los endpoints de Stable Audio, así que lo que practiques con 2.5 te servirá después.
Consejos de prompt que funcionan
Los prompts de ambas versiones premian la especificidad. Una petición vaga como "música relajada" devuelve un fondo genérico. Un prompt que nombra género, instrumentos, estado de ánimo y tempo devuelve algo que puedes usar.

La fórmula de cinco partes
Escribe los prompts en este orden, separados por comas:
- Género: boom bap hip hop, ambient house, post-rock, synthwave cinematográfico
- Instrumentos: piano solemne, batería SP-1200, bombo 808, cuerdas, bajo de onda senoidal
- Ambiente: tranquilo, eufórico, melancólico, tenso
- Tempo: un número, como 90 BPM o 125 BPM
- Textura o escala: cálido, polvoriento, amplio, tonalidad menor
| Prompt débil | Prompt sólido |
|---|
| Música relajante | Instrumental de boom bap hip hop con alma, piano solemne, batería SP-1200, bajo de onda senoidal, tranquilo, 90 BPM |
| Pista para bailar | Ambient house, caja de ritmos 808, palmas, shaker, bajo sintetizado, eufórico, 125 BPM |
| Música épica de película | Post-rock, guitarras, batería, bajo, cuerdas, edificante, fluido, sentimental, 125 BPM |
| Sonido de puerta | Portazo de madera pesada en un salón de piedra, cola de eco larga, sin música |
Para pistas más largas, añade indicaciones de tiempo al final del prompt: "pads suaves durante los primeros 20 segundos, la batería entra a los 20 segundos, desvanecimiento lento al final". Las pistas largas de Stable Audio 3 se benefician más de esto, ya que una pieza de seis minutos necesita un arco. En 2.5, mantén las indicaciones de tiempo breves y juzga el resultado por el oído.
Para los efectos de sonido, cambia la fórmula musical por tres detalles: el objeto, la superficie con la que entra en contacto y el espacio que lo rodea. "Botas sobre grava mojada, cantera vacía, viento lejano" suele superar a "pasos", porque el modelo puede situar el sonido en una habitación.
💡 Atajo: también pueden funcionar dos o tres palabras. Los prompts cortos de género, como "Lo-fi Funk" o "Cinematic Synthwave", dieron pistas de 90 segundos utilizables en los ejemplos de 2.5. Añade detalle solo cuando el primer resultado se desvíe.
Errores que desperdician créditos
- Pedir voces. Stable Audio 3 no tiene voces ni letras, y 2.5 está pensado para instrumentales y diseño de sonido. Usa un modelo de canciones para cantar.
- Acumular adjetivos. Diez palabras de ánimo se anulan entre sí. Elige dos.
- Omitir el tempo. Sin BPM, el ritmo se desvía. Un número lo ancla.
- Repetir a ciegas. Cambia una cosa a la vez y mantén fija la semilla, para saber qué edición ayudó.
- Esperar un estribillo de éxito. Estos modelos son mejores en bases, bucles, ambientes y efectos.
Corregir transiciones débiles
La música generada puede mostrar transiciones débiles, repetición, ritmo inestable, ruido de fondo y finales bruscos. En Stable Audio 3 corriges el tramo malo con inpainting en lugar de empezar de cero. En 2.5, genera un poco más de lo que necesitas, recorta el final débil en cualquier editor de audio y añade un fundido corto.
Al escribir esto, el catálogo de PicassoIA incluye Stable Audio 2.5, no Stable Audio 3. Sigue siendo la forma más rápida de probar un estilo de prompt sin instalar nada, y los hábitos se transfieren.

Paso a paso
- Abre la página de Stable Audio 2.5 en PicassoIA.
- Pega un prompt construido con la fórmula de cinco partes de arriba.
- Fija la duración en segundos. El valor predeterminado es 190, el máximo.
- Deja los pasos en 8 para una primera pasada rápida.
- Deja la escala CFG en 1 y súbela si el resultado ignora tus instrumentos.
- Pulsa generar y escucha. La mayoría de las pistas de 90 segundos terminan en unos seis segundos.
- Copia la semilla que te guste, cambia una palabra del prompt y genera de nuevo.
Ajustes que vale la pena cambiar
| Ajuste | Predeterminado | Qué hace |
|---|
| Prompt | Ninguno | Describe género, instrumentos, estado de ánimo y tempo |
| Duración | 190 | Longitud de la pista en segundos |
| Pasos | 8 | Más pasos cambian velocidad por más detalle |
| Escala CFG | 1 | Valores más altos siguen el prompt con más fidelidad |
| Semilla | Aleatoria | Reutilízala para reproducir un resultado |
Prueba primero duraciones cortas. Un bucle de 30 segundos cuesta menos tiempo de evaluar, y después puedes extender un prompt ganador a la duración completa.
Añadir voces, locuciones y transcripciones
Como ninguna de las dos versiones canta, un proyecto terminado suele necesitar dos o tres herramientas. PicassoIA las reúne en un solo lugar.

Canciones con voz
Cuando el encargo pide letra y cantante, cambia de modelo. Music 2.5 genera canciones completas con voz. Lyria 3 Pro crea canciones de duración completa, y Music from ElevenLabs compone pistas a partir de un prompt de texto. Un flujo habitual: esboza la base instrumental en Stable Audio y luego compárala con un modelo de voz para ver cuál encaja mejor con el video.
Locuciones y transcripciones
Para narrar sobre tu instrumental, Speech 2.8 HD ofrece locuciones de calidad de estudio, Gemini 3.1 Flash TTS ofrece 30 voces en más de 70 idiomas, y V3 from ElevenLabs es una opción de sonido natural para lecturas más largas.
Para convertir grabaciones en texto, pásalas por GPT 4o Transcribe o Gemini 3 Pro. Las transcripciones ayudan con los subtítulos, las notas del programa y a comprobar que una locución dice exactamente lo que dice el guion antes de ponerla bajo la música.
Crea tu primera pista hoy
Entonces, ¿cuál deberías elegir? Depende del trabajo:
| Trabajo | Mejor opción | Por qué |
|---|
| Pasos, impactos y paquete de ambientes | Stable Audio 3 Small SFX | Gratis, sin conexión, funciona en una CPU |
| Bucle para un video o reel | Stable Audio 3 Small o Stable Audio 2.5 | Rápido y barato, y 2.5 no necesita configuración |
| Base de fondo de seis minutos | Stable Audio 3 Medium | El modelo abierto más largo, necesita una GPU |
| Audio a demanda dentro de un producto | Stable Audio 3 Large (API) | Nivel superior, sin servidores que mantener |
| Prueba rápida de una idea de prompt | Stable Audio 2.5 en PicassoIA | Resultados en segundos, nada que instalar |
La forma más rápida de notar la diferencia entre prompts es probarlos. Abre Stable Audio 2.5 en PicassoIA, pega uno de los prompts de la tabla de arriba y genera un bucle de 30 segundos. Después cambia el tempo, sustituye un instrumento y vuelve a escuchar. En diez minutos te habrás hecho una idea de cómo responde esta familia y, cuando quieras voces o transcripciones, los modelos de habla y transcripción están a un clic en la misma plataforma.