Terminaste el montaje, la build del juego funciona y todo suena extrañamente silencioso. Los pasos no hacen ruido, la puerta se cierra sin un golpe seco y el tajo de la espada corta el aire como un fantasma. Un generador de efectos de sonido con IA gratis para videos y juegos cierra esa brecha en minutos: escribes lo que quieres oír, el modelo genera el audio y lo colocas en una línea de tiempo o en un motor de juego. Sin buscar paquetes de samples, sin micrófono y sin estudio de foley.
Este artículo muestra qué funciona ahora mismo en PicassoIA, qué modelos generan audio de verdad, un tutorial completo con Stable Audio 2.5, prompts que puedes pegar hoy y los errores que hacen que el audio generado suene barato. Una advertencia justa desde el principio: el audio con IA es excelente para ambientes, drones, stingers y placeholders, y menos predecible en foley de detalle preciso. Saber esa división te ahorra horas de frustración.
Qué significa realmente "gratis" aquí
La palabra "gratis" se estira mucho en el diseño de sonido. En un proyecto independiente esconde dos preguntas distintas, y confundirlas es la forma en que la gente acaba con un archivo que no puede publicar.
Gratis para generar frente a gratis para publicar
Gratis para generar significa que puedes ejecutar el modelo sin pagar por clip, mediante un nivel gratuito, créditos de prueba o un plan con límites generosos. Gratis para publicar significa que las condiciones te permiten incluir el resultado en un video monetizado o en un juego comercial. Son promesas diferentes. Lee los límites actuales del plan y las condiciones de uso en la página de cada modelo antes de construir una versión alrededor de un solo sonido.
💡 Hábito rápido: anota el modelo, el prompt y la fecha de cada sonido que publiques. Si alguna vez la página de la tienda o un cliente pregunta de dónde viene un efecto, tendrás la respuesta en una línea.
El costo en tiempo que nadie menciona
Incluso cuando generar no cuesta nada, tu tarde sí. Espera generar entre tres y cinco tomas por cada sonido que conserves, y planifica la lista antes de abrir una sola caja de prompt. Una lista ajustada de 30 sonidos que se termina vale más que una lista de deseos de 300 que nunca sale de la hoja de cálculo.
Para un tráiler de sesenta segundos, un primer lote realista se ve así:
- Una cama de ambiente que suena bajo todo el clip
- Seis impactos para cortes, golpes de logotipo y tarjetas de título
- Cuatro sonidos de movimiento para pasos, telas y puertas
- Un stinger para el último momento
- Una línea de voz, si el tráiler necesita narración
Son trece recursos, y con eso basta para que un corte preliminar parezca una pieza terminada.

Los tipos de sonido que todo proyecto necesita
Antes de escribir prompts, clasifica el proyecto en cuatro grupos. Cada uno pide una duración distinta, un estilo de prompt distinto y un nivel de precisión diferente. Si alguna vez has explorado una biblioteca de efectos de sonido de archivo, reconocerás las mismas categorías.
| Grupo | Ejemplos | Duración típica |
|---|
| Impactos e interfaz | Portazos, clics de botón, recogida de monedas, barridos de menú | Menos de 2 segundos |
| Movimiento | Pasos, roce de telas, tajos de espada, ruedas sobre grava | De 1 a 3 segundos |
| Ambiente | Lluvia, viento, multitudes, zumbido de maquinaria, aire de bosque | De 20 a 60 segundos, en bucle |
| Stingers y drones | Jingles de victoria, camas de tensión, golpes de logotipo | De 3 a 30 segundos |
El movimiento es donde brilla el foley tradicional. Un artista de foley pisa una caja de grava con las botas adecuadas y consigue un crujido perfecto en una sola toma. La IA puede aproximar ese crujido, pero ajustar el ritmo exacto de un personaje en pantalla requiere paciencia, así que trata el movimiento como el grupo en el que más regenerarás.

Impactos y clics de interfaz
Los sonidos cortos dependen por completo de los primeros 50 milisegundos. Un clic de botón que empieza con un fundido suave suena blando, así que pide un "transitorio nítido" y recorta cualquier silencio inicial. Para los menús, pide una familia de sonidos en una misma sesión (hover, clic, volver, error) para que compartan el mismo tono y parezcan una sola interfaz en lugar de cuatro archivos sin relación.
Ambiente y clima
El ambiente es donde el audio con IA se gana su lugar. Una cama de bosque, una calle lluviosa o un pasillo con zumbido necesitan minutos de textura, no un solo golpe perfecto, y eso es exactamente lo que los modelos de texto a audio manejan bien. Genera un clip de 30 a 60 segundos y prueba el punto de bucle reproduciendo el final directamente seguido del inicio.

La grabación de campo real sigue siendo maravillosa cuando puedes hacerla. Pero cuando tu juego tiene un nivel de lluvia y el pronóstico dice sol toda la semana, un prompt es más rápido que un billete de avión.

PicassoIA no esconde el audio tras un único botón. El sonido llega desde tres familias de modelos, y cada una encaja con un trabajo distinto.

Modelos de audio con prompts de texto
Stable Audio 2.5 es la opción más directa. Su página de modelo menciona entre sus resultados pistas musicales completas, capas de sonido ambiental y efectos cortos y sueltos, todo a partir de un único prompt de texto. Para stingers y momentos con música, también vale la pena probar los modelos musicales: ElevenLabs Music, MiniMax Music 2.6 y Lyria 3. Son música ante todo, así que úsalos para camas, drones y jingles, no para un portazo.
Modelos de video con audio integrado
Algunos modelos de video generan sonido junto con la imagen. Veo 3.1, Seedance 2.0 y Sora 2 producen clips con audio que sigue la acción en pantalla, de modo que un cristal se rompe y suena a cristal en el momento exacto en que se rompe. El inconveniente es que el sonido está ligado al clip. Si quieres otra toma del audio, tienes que regenerar el video. Elige esta vía cuando necesites imagen y sonido juntos, como en un plano de tráiler, y no cuando necesites un efecto independiente y limpio.
Modelos de voz para gruñidos y narración
Los juegos y los videos necesitan voces tanto como impactos. Speech 2.8 HD y ElevenLabs V3 convierten líneas escritas en habla para tenderos, indicaciones de tutorial, cuentas atrás y locutores. Son modelos de habla, así que no esperes de ellos un rugido ni una explosión.
| Enfoque | Ideal para | Punto débil | Modelos para probar |
|---|
| Texto a audio | Ambiente, drones, stingers, efectos sueltos | El detalle fino del foley varía entre tomas | Stable Audio 2.5 |
| Video con audio | Imagen y sonido juntos | El audio no se puede regenerar por separado | Veo 3.1, Seedance 2.0 |
| Texto a voz | Líneas de voz, narración | No está pensado para efectos que no sean habla | Speech 2.8 HD |
Usa Stable Audio 2.5 en PicassoIA
Como solo necesita un prompt de texto, Stable Audio 2.5 es el camino más rápido desde la idea hasta el archivo de audio. Su página de modelo documenta generaciones de hasta 190 segundos y cinco ajustes:
| Ajuste | Valor por defecto | Qué hace |
|---|
| Prompt | Obligatorio | Describe el sonido que quieres |
| Duración | 190 segundos | Longitud del clip, en segundos |
| Steps | 8 | Más steps implican menos velocidad a cambio de un detalle más nítido |
| CFG scale | 1 | Valores más altos siguen el prompt con más fidelidad |
| Seed | Aleatoria | Reutiliza un valor para reproducir un resultado |

Paso 1: escribe un prompt específico
Abre la página de Stable Audio 2.5 y escribe el sonido como le explicarías un encargo a un artista de foley: qué produce el ruido, qué hace, con qué material choca y en qué espacio ocurre. "Puerta de madera que se cierra de golpe en un pasillo de piedra vacío, eco corto" le da al modelo mucho más con que trabajar que "sonido de puerta".
Paso 2: recorta la duración
La duración por defecto es de 190 segundos, demasiado larga para un portazo. Pon unos pocos segundos para los efectos sueltos y de 30 a 60 segundos para el ambiente. Mantén los steps en el valor por defecto de 8 mientras pruebas ideas y súbelos para las tomas que pienses publicar. Si un resultado ignora la mitad de tu prompt, sube un poco el CFG scale e inténtalo de nuevo.
Paso 3: genera, recorta y guarda
Genera, escucha con auriculares y anota la seed de cualquier toma que se acerque. Recorta el silencio del inicio, añade un fundido diminuto en los últimos milisegundos para evitar clics y guarda el archivo con un nombre que lo describa, como door_slam_stone_hall_02. Ese mismo archivo ya funciona en un editor de video o en un motor de juego sin ningún lío de conversión.
💡 ¿Casi acierta? Mantén fija la seed y cambia una sola palabra del prompt, por ejemplo "madera" por "metal". Con la seed bloqueada, es mucho más fácil oír qué cambió esa palabra.
Prompts que producen sonidos utilizables
Una fórmula sencilla para el prompt
Usa cinco partes en este orden: fuente, acción, material, espacio, duración. Por ejemplo: "Portón de hierro pesado (fuente) se abre girando (acción), bisagras oxidadas (material), patio grande y vacío con eco (espacio), 3 segundos (duración)." Indica la duración en el prompt y ajústala en el campo de duración para que ambas coincidan.
Algunas palabras dirigen los resultados más que otras:
- Seco o cercano mantiene el sonido compacto, bueno para interfaz e impactos.
- Lejano o apagado aleja el sonido dentro de la sala, bueno para ambientes.
- Por capas pide más de un componente, lo que encaja con explosiones y magia.
- En bucle sugiere una textura constante sin grandes eventos.
Evita acumular adjetivos. Dos o tres palabras precisas valen más que diez vagas.
Prompts para pegar hoy
| Sonido | Prompt |
|---|
| Portazo | Pesada puerta de madera se cierra de golpe en un pasillo de piedra vacío, eco corto, 2 segundos |
| Pasos | Botas que avanzan lentamente sobre grava mojada, ritmo constante, al aire libre, fondo silencioso, 5 segundos |
| Golpe de espada | Espada de acero que corta el aire con rapidez, silbido agudo, sin voces, 1 segundo |
| Recogida de moneda | Tintineo metálico y brillante de moneda, corto y limpio, juego casual para dispositivos móviles, 1 segundo |
| Ambiente de lluvia | Lluvia constante sobre una ventana, tráfico lejano, calmada, en bucle, 45 segundos |
| Ambiente de bosque | Mañana tranquila en el bosque, pájaros a lo lejos, brisa suave entre las hojas, en bucle, 60 segundos |
| Drone de tensión | Drone grave y retumbante, crescendo lento, inquietante, sin melodía, 20 segundos |
| Stinger de victoria | Fanfarria corta y triunfal de metales y cuerda, ascendente, termina de forma limpia, 4 segundos |
Guarda los ganadores en una hoja de prompts junto a la seed que los produjo. Al cabo de una semana tendrás un paquete de sonidos personal que podrás reconstruir cada vez que un proyecto lo necesite.
Poner los sonidos a trabajar
En ediciones de video
Coloca cada efecto en su propia pista, alineado con el fotograma donde cae la acción. Superpón dos o tres sonidos en cada momento importante: un golpe grave para el peso, una capa más aguda para el detalle y un toque de tono de sala para el realismo. Si tu material procede de un rodaje real, un operador de pértiga ya capturó el diálogo y algo de sonido natural, así que usa los efectos generados para rellenar huecos en lugar de reemplazarlo todo.
El timing importa más de lo que la mayoría cree. Desplázate hasta el fotograma exacto de la acción, pon ahí el momento más fuerte del sonido y, si todavía suena tarde, adelántalo un fotograma o dos. Un sonido que llega ligeramente antes se percibe como natural, mientras que uno que llega tarde se percibe como un error.

En las builds de juego
Los juegos repiten sonidos cientos de veces, y la repetición es lo que hace que el audio suene barato. Genera de cuatro a seis variaciones de cada sonido frecuente (pasos, golpes, recogidas) y deja que el motor elija una al azar, con un pequeño cambio de tono. En los ambientes, prueba el bucle dentro del motor y no solo en tu editor. Empieza con placeholders generados desde el primer día y reemplaza después solo los sonidos que más escuchan los jugadores.
Organiza los archivos antes de que la carpeta se desordene. Agrúpalos por categoría, usa un único patrón de nombres (footstep_gravel_01, footstep_gravel_02) y lleva todos los sonidos a un volumen similar, para que los controles deslizantes de volumen de tu menú de ajustes se comporten como esperan los jugadores.

Niveles de mezcla que aguantan
Los diálogos y las señales de juego importantes se quedan arriba, la música va debajo de ellos y el ambiente va debajo de la música. Como punto de partida, sitúa el ambiente unos 12 a 18 dB por debajo del diálogo y ajusta después a oído. Revisa la mezcla en los altavoces de un equipo portátil y en auriculares, porque cada uno revela problemas diferentes.

Errores que hacen que el audio suene barato
- Reutilizar una sola toma en todas partes. Los oyentes detectan la repetición después de tres o cuatro reproducciones. Genera variaciones.
- Olvidar la sala. Un portazo seco dentro de una escena de catedral rompe la ilusión. Ajusta la reverberación al espacio que se ve en pantalla.
- Puntos de bucle bruscos. Si un ambiente hace clic en la unión, haz un crossfade del último segundo sobre el primero.
- Picos altos. Revisa los niveles antes de importar. Un clip que llega al máximo se distorsionará cuando lo superpongas con otros sonidos.
- Demasiado limpio. Los impactos reales tienen capas. Combina un golpe generado con un clic brillante y un poco de tono de sala.
- Sin notas de origen. Registra el modelo, el prompt, la seed y la fecha para poder reconstruir o reemplazar cualquier sonido más adelante.
Ninguno de estos problemas viene de la IA en sí. Vienen de tratar un archivo generado como algo terminado, cuando en realidad es material en bruto que todavía necesita un oído humano, un recorte y un lugar en la mezcla.
Crea tus propios sonidos hoy
Elige una escena, un plano de tráiler de treinta segundos o una sola sala de juego, y construye todo su paisaje sonoro esta tarde. Escribe la lista, abre Stable Audio 2.5, genera cinco efectos y una cama de ambiente, y añádelos a tu proyecto.
Después usa el resto de PicassoIA para la escena en sí. Crea fotogramas fijos con un modelo de texto a imagen como Seedream 4.5, anímalos con Seedance 2.0 y pon música al resultado con MiniMax Music 2.6. Imágenes, video y audio viven en un mismo lugar, así que puedes experimentar libremente sin hacer malabares con cinco herramientas distintas. Empieza con un solo prompt y mira lo rápido que un clip mudo se convierte en algo que quieras ver.