Stable Audio 3 frente a 2.5: modelos abiertos, API y consejos de prompts

Stable Audio 3 trae pesos abiertos, pistas de seis minutos e inpainting, mientras que Stable Audio 2.5 sigue siendo la opción rápida, sin configuración. Compara las especificaciones lado a lado, qué permite la Community License, cuánto cuesta cada pista con la API y la fórmula de prompt que da música más limpia en ambos.

Stable Audio 3 frente a 2.5: modelos abiertos, API y consejos de prompts
Cristian Da Conceicao
Fundador de Picasso IA

Stability AI lanzó Stable Audio 3 el 20 de mayo de 2026, y la primera pregunta de todos es si reemplaza a la versión 2.5. No es así. Ahora las dos cumplen funciones distintas. La nueva familia trae pesos abiertos que puedes ejecutar en tu propio equipo, pistas que superan los seis minutos y herramientas de edición como el inpainting. Stable Audio 2.5 sigue siendo la forma más rápida, sin configuración, de obtener un instrumental limpio en menos de un minuto. A continuación encontrarás las especificaciones lado a lado, la licencia y el costo de la API en cifras claras, consejos de prompt que sirven para ambos y una guía para usar 2.5 en PicassoIA hoy.

Vista desde arriba de un escritorio de roble con un equipo portátil, auriculares, una libreta y un controlador MIDI

Stable Audio 3 de un vistazo

Stable Audio 3 no es un solo modelo. Es una familia de cuatro, construida sobre una arquitectura nueva: un autoencoder semántico-acústico que comprime el audio unas 4096 veces y permite generar cualquier duración, hasta el segundo. Tres de los cuatro se publican como pesos abiertos en Hugging Face. El más grande solo está disponible por API.

Los cuatro modelos

ModeloParámetrosDuración máximaAcceso
Small SFX459 millonesUnos 2 minutosPesos abiertos
Small (música)459 millonesUnos 2 minutosPesos abiertos
Medium1.400 millones6 min 20 sPesos abiertos
Large2.700 millonesMás de 6 minutosAPI o alojamiento empresarial

Los cuatro aceptan un prompt de texto. La familia también gestiona audio a audio, que remodela un clip existente manteniendo su ritmo, y inpainting, que regenera un tramo de una pista mientras el resto permanece intacto. El inpainting tiene tres variantes: un solo segmento, varios segmentos a la vez y continuación causal, que extiende una pista desde donde termina. Small y Medium admiten ajuste fino con LoRA, y el soporte para ComfyUI llegó el mismo día del lanzamiento.

Cuatro micrófonos de condensador de tamaño creciente alineados sobre una mesa de madera

💡 Conviene saberlo: ninguno de los cuatro modelos canta. No hay voces ni letras en toda la familia. Si una pista necesita una voz, se añade con un modelo aparte, y las últimas secciones explican cómo.

Qué cambió desde 2.5

Stable Audio 2.5 llega hasta 190 segundos por generación, unos tres minutos. Stable Audio 3 Medium lo duplica, con 6 minutos y 20 segundos. El entrenamiento también se volvió más limpio: según se informa, el conjunto de datos tiene unas 1,28 millones de grabaciones con licencia, unas 806.000 pistas de AudioSparx y unos 473.000 archivos de Creative Commons de Freesound. Se excluyó el material protegido por derechos de autor, lo que importa si piensas publicar lo que generes.

Especificaciones lado a lado

Aquí tienes la versión corta en una sola tabla. Los precios y las duraciones provienen de los informes públicos de lanzamiento y de la página del modelo en PicassoIA, así que consulta la página oficial de precios antes de presupuestar un proyecto grande.

CaracterísticaStable Audio 2.5Stable Audio 3
Duración máxima190 segundos6 min 20 s (Medium)
PesosSolo alojadosAbiertos para Small SFX, Small, Medium
Ejecutar en tu equipoNoSmall en CPU, Medium en GPU
VocesEnfoque instrumentalNinguna
Precio de API por ejecuciónUnos $0,20 (20 créditos)$0,26 (26 créditos)
Herramientas de ediciónPrompt de texto en PicassoIATexto, audio a audio, inpainting, continuación
Ajuste finoNoLoRA en Small y Medium
ConfiguraciónNinguna, funciona en el navegadorDescargar los pesos o llamar a la API

Dos monitores de estudio negros frente a la cámara en una sala acondicionada acústicamente

Dónde gana todavía 2.5

Velocidad y sencillez. Los ejemplos de la página de Stable Audio 2.5 produjeron pistas de 90 segundos en unos seis segundos cada una, con los 8 pasos predeterminados. Abres una página, escribes un prompt y pulsas generar. Sin entorno de Python, sin controladores de GPU y sin formulario de licencia.

Precio por ejecución. Con unos 20 créditos frente a 26, 2.5 es la llamada a la API más barata cuando solo necesitas un bucle corto.

Iteración predecible. Reutiliza una semilla y recuperarás el mismo audio, así que puedes cambiar una palabra del prompt y escuchar exactamente qué hizo.

Dónde se adelanta 3

Duración. Una pista Medium de seis minutos basta para una cue de cortometraje o una base para un podcast, sin unir clips.

Control. El inpainting te permite corregir el compás 40 sin volver a generar toda la canción. La continuación extiende una pista desde donde se detiene. El audio a audio remodela un clip que ya tienes.

Control del flujo de trabajo. Los pesos abiertos permiten trabajar sin conexión, mantener el material inédito fuera de servidores de terceros y hacer ajuste fino con LoRA sobre tu propia biblioteca de sonidos. Un estudio de videojuegos, por ejemplo, puede entrenar Small SFX con sus propias grabaciones de foley para que cada paso encaje con el estilo de la casa.

Revisión honesta de calidad. Una reseña puntuó la familia con 7,8 sobre 10 y señaló sus puntos fuertes: drones ambientales, foley, efectos de sonido, bucles instrumentales y bases atmosféricas. La misma reseña observó que la música puede parecer correcta sin resultar interesante, y que los géneros rítmicos tienden a aplanarse. Considera a 3 una herramienta sólida para bases y efectos, no un sustituto de una banda.

Pesos abiertos: qué puedes ejecutar

Los pesos abiertos cambian quién puede usar esto. Antes, los modelos de audio de esta calidad estaban detrás de una API. Ahora un equipo portátil y una descarga bastan para los dos modelos pequeños.

Un hombre escuchando con auriculares intraurales frente a un equipo portátil en una sala con luz de sol

Modelos pequeños en una CPU

Small SFX y Small se ejecutan en una CPU, sin tarjeta gráfica dedicada. Los informes de lanzamiento sitúan los tiempos de generación por debajo de medio segundo en una GPU de servidor H200, y la intención del diseño es la composición musical completa en el propio dispositivo, sin conexión y sin los límites de muestras cortas que tenían los modelos abiertos anteriores. Usa Small SFX para impactos, ambientes, pasos y sonidos de aire en movimiento. Usa Small para bucles y piezas instrumentales cortas de hasta dos minutos.

Ambos modelos pequeños también admiten ajuste fino con LoRA. Un LoRA es un complemento pequeño entrenado con tus propios clips, como las grabaciones de batería de tu banda o la biblioteca de foley de un videojuego, y empuja cada generación hacia ese carácter. Como el complemento es diminuto, el trabajo es mucho más ligero que reentrenar un modelo completo.

Medium es la opción más pesada, con 1.400 millones de parámetros. Las notas de configuración indican una GPU CUDA con Flash Attention 2 como vía compatible, y la velocidad informada en una H200 es de menos de dos segundos por pista. Un revisor midió unos segundos en un MacBook Pro M4, así que consulta el repositorio para tu hardware exacto antes de planificar en torno a ello.

Las reglas de la licencia en palabras sencillas

Los modelos abiertos usan la Stability AI Community License.

  • Menos de 1 millón de dólares de ingresos anuales: gratis para descargar, ejecutar, ajustar y usar comercialmente una vez que te registres en la Community License. Eres dueño de tus resultados, en la medida en que lo permita la ley.
  • Más de 1 millón de dólares: necesitas una Enterprise License, que además incluye indemnización legal.
  • Large: nunca se descarga. Se accede a través de la API de Stability, de fal.ai o mediante alojamiento empresarial propio.

Dos manos firmando un acuerdo impreso junto a una interfaz de audio

💡 Léelo antes de publicar: "eres dueño del resultado" no es lo mismo que "el resultado está protegido por derechos de autor". En muchos países, el audio generado íntegramente por una máquina tiene una protección más débil que una obra hecha por personas. Si una pista es central para tu marca, añade tu propia interpretación o tus ediciones encima.

Usar la API

No todo el mundo quiere instalar nada. La ruta alojada es el camino más corto de la idea al archivo.

Una desarrolladora escribiendo en un escritorio de pie con auriculares de estudio alrededor del cuello

Costo por generación

Stability cobra en créditos, y un crédito equivale a un centavo. Una generación de Stable Audio 3 cuesta 26 créditos, o $0,26. Stable Audio 2.5 se informa en 20 créditos, unos $0,20. Un detalle a tener en cuenta: el saldo inicial gratuito de 25 créditos es un crédito menos que una sola ejecución de Stable Audio 3, así que presupuesta una pequeña recarga incluso para hacer pruebas.

VolumenA $0,26 por ejecuciónA $0,20 por ejecución
10 pistas$2,60$2,00
100 pistas$26,00$20,00
1.000 pistas$260,00$200,00

Cuándo la API gana a lo local

Elige la API cuando necesites el modelo Large, porque es la única forma de acceder a él sin un contrato empresarial. Elígela también cuando no tengas GPU, cuando tu volumen sea irregular o cuando un producto necesite audio a demanda sin que tú mantengas servidores. Elige los pesos locales cuando generes miles de clips, trabajes sin conexión o necesites ajuste fino.

Un flujo de trabajo típico alojado es así:

  1. Escribe el prompt con género, instrumentos, estado de ánimo y tempo.
  2. Fija la duración que necesites, en segundos enteros.
  3. Envía la solicitud y espera el archivo de audio.
  4. Escucha, cambia una variable y vuelve a generar.
  5. Recorta, aplica fundidos y haz bucle con el resultado en tu editor.

El esquema alojado de Stable Audio 2.5 es sencillo: un prompt de texto, una duración, un número de pasos, una escala CFG y una semilla opcional. Son los mismos controles que encontrarás en la mayoría de los endpoints de Stable Audio, así que lo que practiques con 2.5 te servirá después.

Consejos de prompt que funcionan

Los prompts de ambas versiones premian la especificidad. Una petición vaga como "música relajada" devuelve un fondo genérico. Un prompt que nombra género, instrumentos, estado de ánimo y tempo devuelve algo que puedes usar.

Una mano escribiendo en una libreta junto a un sintetizador analógico pequeño

La fórmula de cinco partes

Escribe los prompts en este orden, separados por comas:

  1. Género: boom bap hip hop, ambient house, post-rock, synthwave cinematográfico
  2. Instrumentos: piano solemne, batería SP-1200, bombo 808, cuerdas, bajo de onda senoidal
  3. Ambiente: tranquilo, eufórico, melancólico, tenso
  4. Tempo: un número, como 90 BPM o 125 BPM
  5. Textura o escala: cálido, polvoriento, amplio, tonalidad menor
Prompt débilPrompt sólido
Música relajanteInstrumental de boom bap hip hop con alma, piano solemne, batería SP-1200, bajo de onda senoidal, tranquilo, 90 BPM
Pista para bailarAmbient house, caja de ritmos 808, palmas, shaker, bajo sintetizado, eufórico, 125 BPM
Música épica de películaPost-rock, guitarras, batería, bajo, cuerdas, edificante, fluido, sentimental, 125 BPM
Sonido de puertaPortazo de madera pesada en un salón de piedra, cola de eco larga, sin música

Para pistas más largas, añade indicaciones de tiempo al final del prompt: "pads suaves durante los primeros 20 segundos, la batería entra a los 20 segundos, desvanecimiento lento al final". Las pistas largas de Stable Audio 3 se benefician más de esto, ya que una pieza de seis minutos necesita un arco. En 2.5, mantén las indicaciones de tiempo breves y juzga el resultado por el oído.

Para los efectos de sonido, cambia la fórmula musical por tres detalles: el objeto, la superficie con la que entra en contacto y el espacio que lo rodea. "Botas sobre grava mojada, cantera vacía, viento lejano" suele superar a "pasos", porque el modelo puede situar el sonido en una habitación.

💡 Atajo: también pueden funcionar dos o tres palabras. Los prompts cortos de género, como "Lo-fi Funk" o "Cinematic Synthwave", dieron pistas de 90 segundos utilizables en los ejemplos de 2.5. Añade detalle solo cuando el primer resultado se desvíe.

Errores que desperdician créditos

  • Pedir voces. Stable Audio 3 no tiene voces ni letras, y 2.5 está pensado para instrumentales y diseño de sonido. Usa un modelo de canciones para cantar.
  • Acumular adjetivos. Diez palabras de ánimo se anulan entre sí. Elige dos.
  • Omitir el tempo. Sin BPM, el ritmo se desvía. Un número lo ancla.
  • Repetir a ciegas. Cambia una cosa a la vez y mantén fija la semilla, para saber qué edición ayudó.
  • Esperar un estribillo de éxito. Estos modelos son mejores en bases, bucles, ambientes y efectos.

Corregir transiciones débiles

La música generada puede mostrar transiciones débiles, repetición, ritmo inestable, ruido de fondo y finales bruscos. En Stable Audio 3 corriges el tramo malo con inpainting en lugar de empezar de cero. En 2.5, genera un poco más de lo que necesitas, recorta el final débil en cualquier editor de audio y añade un fundido corto.

Usar Stable Audio 2.5 en PicassoIA

Al escribir esto, el catálogo de PicassoIA incluye Stable Audio 2.5, no Stable Audio 3. Sigue siendo la forma más rápida de probar un estilo de prompt sin instalar nada, y los hábitos se transfieren.

Vista por encima del hombro de una mujer con auriculares mirando una forma de onda en un equipo portátil

Paso a paso

  1. Abre la página de Stable Audio 2.5 en PicassoIA.
  2. Pega un prompt construido con la fórmula de cinco partes de arriba.
  3. Fija la duración en segundos. El valor predeterminado es 190, el máximo.
  4. Deja los pasos en 8 para una primera pasada rápida.
  5. Deja la escala CFG en 1 y súbela si el resultado ignora tus instrumentos.
  6. Pulsa generar y escucha. La mayoría de las pistas de 90 segundos terminan en unos seis segundos.
  7. Copia la semilla que te guste, cambia una palabra del prompt y genera de nuevo.

Ajustes que vale la pena cambiar

AjustePredeterminadoQué hace
PromptNingunoDescribe género, instrumentos, estado de ánimo y tempo
Duración190Longitud de la pista en segundos
Pasos8Más pasos cambian velocidad por más detalle
Escala CFG1Valores más altos siguen el prompt con más fidelidad
SemillaAleatoriaReutilízala para reproducir un resultado

Prueba primero duraciones cortas. Un bucle de 30 segundos cuesta menos tiempo de evaluar, y después puedes extender un prompt ganador a la duración completa.

Añadir voces, locuciones y transcripciones

Como ninguna de las dos versiones canta, un proyecto terminado suele necesitar dos o tres herramientas. PicassoIA las reúne en un solo lugar.

Una cantante con chaqueta vaquera frente a un micrófono de condensador dentro de una cabina de voz

Canciones con voz

Cuando el encargo pide letra y cantante, cambia de modelo. Music 2.5 genera canciones completas con voz. Lyria 3 Pro crea canciones de duración completa, y Music from ElevenLabs compone pistas a partir de un prompt de texto. Un flujo habitual: esboza la base instrumental en Stable Audio y luego compárala con un modelo de voz para ver cuál encaja mejor con el video.

Locuciones y transcripciones

Para narrar sobre tu instrumental, Speech 2.8 HD ofrece locuciones de calidad de estudio, Gemini 3.1 Flash TTS ofrece 30 voces en más de 70 idiomas, y V3 from ElevenLabs es una opción de sonido natural para lecturas más largas.

Para convertir grabaciones en texto, pásalas por GPT 4o Transcribe o Gemini 3 Pro. Las transcripciones ayudan con los subtítulos, las notas del programa y a comprobar que una locución dice exactamente lo que dice el guion antes de ponerla bajo la música.

Crea tu primera pista hoy

Entonces, ¿cuál deberías elegir? Depende del trabajo:

TrabajoMejor opciónPor qué
Pasos, impactos y paquete de ambientesStable Audio 3 Small SFXGratis, sin conexión, funciona en una CPU
Bucle para un video o reelStable Audio 3 Small o Stable Audio 2.5Rápido y barato, y 2.5 no necesita configuración
Base de fondo de seis minutosStable Audio 3 MediumEl modelo abierto más largo, necesita una GPU
Audio a demanda dentro de un productoStable Audio 3 Large (API)Nivel superior, sin servidores que mantener
Prueba rápida de una idea de promptStable Audio 2.5 en PicassoIAResultados en segundos, nada que instalar

La forma más rápida de notar la diferencia entre prompts es probarlos. Abre Stable Audio 2.5 en PicassoIA, pega uno de los prompts de la tabla de arriba y genera un bucle de 30 segundos. Después cambia el tempo, sustituye un instrumento y vuelve a escuchar. En diez minutos te habrás hecho una idea de cómo responde esta familia y, cuando quieras voces o transcripciones, los modelos de habla y transcripción están a un clic en la misma plataforma.

Compartir este artículo

Elige tu idioma