Você terminou a edição, a build do jogo roda, e tudo está estranhamente silencioso. Os passos não fazem barulho, a porta fecha sem baque, o golpe da espada corta o ar como um fantasma. Um gerador de efeitos sonoros com IA grátis para vídeos e jogos resolve essa lacuna em minutos: você digita o som que quer ouvir, o modelo o renderiza e você coloca o arquivo na linha do tempo ou no motor do jogo. Sem caçar pacotes de samples, sem microfone, sem estúdio de foley.
Este artigo mostra o que funciona agora no PicassoIA, quais modelos realmente produzem áudio, um passo a passo completo com o Stable Audio 2.5, prompts que você pode colar hoje e os erros que fazem o áudio gerado soar barato. Um aviso justo logo de início: o áudio por IA é excelente para ambientes, drones, stingers e placeholders, e menos previsível para foley com muitos detalhes. Saber essa divisão poupa horas de frustração.
O que "grátis" realmente significa aqui
A palavra "grátis" é bastante esticada no design de som. Em um projeto independente, ela esconde duas questões separadas, e misturá-las é o que leva as pessoas a ficar com um arquivo que não podem publicar.
Grátis para gerar ou grátis para publicar
Grátis para gerar significa que você pode rodar o modelo sem pagar por clipe, por meio de um nível gratuito, créditos de teste ou um plano com limites generosos. Grátis para publicar significa que os termos permitem colocar o resultado dentro de um vídeo monetizado ou de um jogo comercial. São promessas diferentes. Leia os limites atuais do plano e os termos de uso em cada página de modelo antes de montar uma versão em torno de um único som.
💡 Hábito rápido: anote o modelo, o prompt e a data de cada som que for para o produto final. Se uma página da loja ou um cliente um dia perguntar de onde veio um efeito, você terá a resposta em uma linha.
O custo de tempo que ninguém menciona
Mesmo quando gerar não custa nada, sua tarde custa. Espere gerar de três a cinco versões para cada som que você mantém, e planeje a lista antes de abrir qualquer campo de prompt. Uma lista enxuta de 30 sons que chega ao fim vale mais do que uma lista de desejos com 300 que nunca sai da planilha.
Para um trailer de sessenta segundos, um primeiro lote realista fica assim:
- Uma base de ambiente que toca por todo o clipe
- Seis impactos para cortes, aparições de logo e cartões de título
- Quatro sons de movimento para passos, tecido e portas
- Um stinger para o momento final
- Uma fala de voz, se o trailer precisar de narração
São treze itens, e isso basta para fazer um corte bruto parecer uma peça acabada.

Tipos de som que todo projeto precisa
Antes de escrever os prompts, organize o projeto em quatro grupos. Cada um pede uma duração diferente, um estilo de prompt diferente e um nível de precisão diferente. Se você já navegou por uma biblioteca de efeitos sonoros de banco de sons, vai reconhecer as mesmas categorias.
| Grupo | Exemplos | Duração típica |
|---|
| Impactos e interface | Batidas de porta, cliques de botão, coletas de moedas, swooshes de menu | Menos de 2 segundos |
| Movimento | Passos, farfalhar de tecido, golpes de espada, rodas em cascalho | De 1 a 3 segundos |
| Ambiente | Chuva, vento, multidões, zumbido de máquinas, ar de floresta | De 20 a 60 segundos, com loop |
| Stingers e drones | Jingles de vitória, bases de tensão, aparições de logo | De 3 a 30 segundos |
O movimento é onde o foley tradicional brilha. Um artista de foley pisa em uma caixa de cascalho com as botas certas e consegue aquele estalo perfeito em uma tomada só. A IA consegue aproximar esse estalo, mas acertar o ritmo exato de um personagem na tela exige paciência, então trate o movimento como o grupo em que você mais vai regenerar.

Impactos e cliques de interface
Sons curtos dependem totalmente dos primeiros 50 milissegundos. Um clique de botão que começa com um fade in suave soa abafado, então peça um "transiente nítido" e corte qualquer silêncio no início. Para menus, peça uma família de sons em uma mesma sessão (hover, clique, voltar, erro) para que compartilhem o mesmo tom e pareçam uma interface só, e não quatro arquivos sem relação.
Ambiente e clima
O ambiente é onde o áudio por IA ganha seu lugar. Uma base de floresta, uma rua chuvosa ou um corredor com zumbido precisa de minutos de textura, não de um único golpe perfeito, e é exatamente isso que os modelos de texto para áudio fazem bem. Gere um clipe de 30 a 60 segundos e teste o ponto de loop tocando o final direto no começo.

Gravação de campo real ainda é maravilhosa quando você consegue fazê-la. Mas quando seu jogo tem uma fase de chuva e a previsão diz sol a semana toda, um prompt é mais rápido do que uma passagem de avião.

O PicassoIA não esconde o áudio atrás de um único botão. O som vem de três famílias de modelos, e cada uma serve a um tipo de trabalho diferente.

Modelos de áudio com prompts de texto
O Stable Audio 2.5 é a opção mais direta. A página do modelo lista faixas musicais completas, camadas de som ambiente e efeitos curtos de um único disparo como saídas, tudo a partir de um único prompt de texto. Para stingers e momentos com trilha, os modelos musicais também valem a pena: ElevenLabs Music, MiniMax Music 2.6 e Lyria 3. Eles são musicais antes de tudo, então use-os para bases, drones e jingles, e não para uma única batida de porta.
Modelos de vídeo com áudio integrado
Alguns modelos de vídeo geram som junto com a imagem. O Veo 3.1, o Seedance 2.0 e o Sora 2 produzem clipes com áudio que acompanha a ação na tela, então um vidro se quebra e soa como vidro no instante em que se quebra. O problema é que o som fica preso ao clipe. Se você quiser outra versão do áudio, precisa regenerar o vídeo. Escolha essa rota quando precisar de imagem e som juntos, como em uma tomada de trailer, e não quando precisar de um efeito avulso e limpo.
Modelos de voz para latidos e narração
Jogos e vídeos precisam de vozes tanto quanto de impactos. O Speech 2.8 HD e o ElevenLabs V3 transformam falas escritas em voz para lojistas, dicas de tutorial, contagens regressivas e locutores. São modelos de fala, então não espere rugido nem explosão deles.
| Abordagem | Melhor para | Ponto fraco | Modelos para testar |
|---|
| Texto para áudio | Ambiente, drones, stingers, disparos únicos | Detalhes finos de foley variam entre as versões | Stable Audio 2.5 |
| Vídeo com áudio | Imagem e som juntos | O áudio não pode ser regenerado sozinho | Veo 3.1, Seedance 2.0 |
| Texto para fala | Falas, narração | Não feito para efeitos que não são falas | Speech 2.8 HD |
Use o Stable Audio 2.5 no PicassoIA
Como precisa apenas de um prompt de texto, o Stable Audio 2.5 é o caminho mais rápido da ideia ao arquivo de áudio. A página do modelo documenta geração de até 190 segundos e cinco configurações:
| Configuração | Padrão | O que faz |
|---|
| Prompt | Obrigatório | Descreve o som que você quer |
| Duração | 190 segundos | Tamanho do clipe, em segundos |
| Steps | 8 | Mais steps trocam velocidade por detalhe mais nítido |
| CFG scale | 1 | Valores maiores seguem o prompt com mais fidelidade |
| Seed | Aleatória | Reutilize um valor para reproduzir um resultado |

Passo 1: escreva um prompt específico
Abra a página do Stable Audio 2.5 e descreva o som como você faria um briefing para um artista de foley: o que faz o barulho, o que ele faz, em que material bate e em que ambiente está. "Porta de madeira batendo com força num corredor de pedra vazio, eco curto" dá ao modelo muito mais coisa para trabalhar do que "som de porta".
Passo 2: reduza a duração
A duração padrão é de 190 segundos, muito longa para uma batida de porta. Defina alguns segundos para disparos únicos e de 30 a 60 segundos para ambientes. Mantenha os steps no padrão de 8 enquanto testa ideias e, depois, aumente-os para as versões que pretende usar no produto final. Se um resultado ignorar metade do seu prompt, aumente um pouco o CFG scale e tente de novo.
Passo 3: gere, corte e salve
Gere, ouça com fones de ouvido e anote a seed de qualquer versão que chegue perto do desejado. Corte o silêncio do início, adicione um fade bem curto nos últimos milissegundos para evitar cliques e salve o arquivo com um nome que o descreva, como door_slam_stone_hall_02. Esse mesmo arquivo já funciona em um editor de vídeo ou em um motor de jogo sem nenhuma dor de cabeça de conversão.
💡 Quase lá? Mantenha a seed fixa e mude uma única palavra no prompt, como "madeira" para "metal". Com a seed travada, fica muito mais fácil ouvir o que essa palavra mudou.
Prompts que produzem sons utilizáveis
Uma fórmula simples de prompt
Use cinco partes nesta ordem: fonte, ação, material, espaço, duração. Por exemplo: "Portão de ferro pesado (fonte) se abre (ação), dobradiças enferrujadas (material), pátio grande e vazio com eco (espaço), 3 segundos (duração)." Diga a duração no prompt e defina-a no campo de duração para que as duas coisas batam.
Algumas palavras orientam os resultados mais do que outras:
- Seco ou próximo mantém o som firme, bom para interface e impactos.
- Distante ou abafado empurra o som para trás no ambiente, bom para ambientes.
- Em camadas pede mais de um componente, o que combina com explosões e magia.
- Com loop sugere uma textura constante, sem grandes eventos.
Evite acumular adjetivos. Duas ou três palavras precisas valem mais do que dez vagas.
Prompts para colar hoje
| Som | Prompt |
|---|
| Batida de porta | Porta de madeira pesada batendo com força num corredor de pedra vazio, eco curto, 2 segundos |
| Passos | Botas lentas sobre cascalho molhado, ritmo constante, ao ar livre, fundo silencioso, 5 segundos |
| Golpe de espada | Golpe rápido de espada de aço cortando o ar, sopro agudo, sem vozes, 1 segundo |
| Coleta de moeda | Tilintar metálico e brilhante de moeda, curto, limpo, jogo casual para celular, 1 segundo |
| Ambiente de chuva | Chuva constante numa janela, trânsito distante, calmo, com loop, 45 segundos |
| Ambiente de floresta | Manhã tranquila na floresta, pássaros ao longe, brisa leve nas folhas, com loop, 60 segundos |
| Drone de tensão | Drone grave e retumbante, crescendo devagar, inquietante, sem melodia, 20 segundos |
| Stinger de vitória | Fanfarra curta e triunfante de metais e cordas, em crescendo, termina de forma limpa, 4 segundos |
Guarde os vencedores em uma planilha de prompts ao lado da seed que os produziu. Depois de uma semana, você terá um pacote de sons pessoal que pode refazer sempre que um projeto precisar.
Colocando os sons para trabalhar
Em edições de vídeo
Coloque cada efeito em sua própria trilha, alinhado ao quadro em que a ação acontece. Sobreponha dois ou três sons em cada momento importante: um baque grave para dar peso, uma camada mais nítida para os detalhes e um toque de ambiência da sala para o realismo. Se sua filmagem veio de uma gravação real, um operador de microfone de vara já captou diálogos e alguns sons naturais, então use os efeitos gerados para preencher lacunas, e não para substituir tudo.
O timing importa mais do que a maioria das pessoas espera. Vá até o quadro exato da ação, posicione ali o momento mais forte do som e, se ainda parecer atrasado, adiante um ou dois quadros. Um som que chega levemente antes soa natural, enquanto um que chega atrasado soa como erro.

Em builds de jogos
Jogos repetem sons centenas de vezes, e a repetição é o que faz o áudio parecer barato. Gere de quatro a seis variações de cada som frequente (passos, golpes, coletas) e deixe o motor escolher uma aleatoriamente, com uma pequena variação de tom por cima. Para ambientes, teste o loop dentro do motor e não apenas no editor. Comece com placeholders gerados no primeiro dia e substitua apenas os sons que os jogadores mais ouvem.
Organize os arquivos antes que a pasta vire bagunça. Agrupe-os por categoria, use um único padrão de nomes (footstep_gravel_01, footstep_gravel_02) e leve todos os sons a um volume parecido, para que os controles deslizantes de volume no menu de configurações funcionem como os jogadores esperam.

Níveis de mixagem que se sustentam
Diálogos e sinais importantes de jogabilidade ficam no topo, a música fica abaixo deles e o ambiente fica abaixo disso. Como ponto de partida, coloque o ambiente cerca de 12 a 18 dB abaixo dos diálogos e depois ajuste de ouvido. Confira a mixagem em alto-falantes de notebook e em fones de ouvido, já que os dois revelam problemas diferentes.

Erros que tornam o áudio barato
- Reutilizar uma mesma versão em todo lugar. Quem ouve percebe a repetição depois de três ou quatro reproduções. Gere variações.
- Ignorar a acústica do espaço. Uma batida de porta seca dentro de uma cena de catedral quebra a ilusão. Ajuste a reverberação ao espaço que aparece na tela.
- Pontos de loop bruscos. Se um ambiente dá um clique na emenda, faça um crossfade do último segundo sobre o primeiro.
- Picos altos. Confira os níveis antes de importar. Um clipe que bate no máximo vai distorcer quando você o sobrepuser a outros sons.
- Limpo demais. Impactos reais têm camadas. Combine um baque gerado com um clique brilhante e um pouco de tom de sala.
- Sem notas de origem. Registre o modelo, o prompt, a seed e a data para poder refazer ou substituir qualquer som depois.
Nenhum desses problemas vem da própria IA. Eles vêm de tratar um arquivo gerado como algo finalizado, quando na verdade ele é matéria-prima que ainda precisa de um ouvido humano, de um corte e de um lugar na mixagem.
Crie seus próprios sons hoje
Escolha uma cena, uma tomada de trailer de trinta segundos ou uma única sala de jogo, e monte toda a paisagem sonora dela nesta tarde. Escreva a lista, abra o Stable Audio 2.5, gere cinco efeitos e uma base de ambiente, e coloque tudo no seu projeto.
Depois use o restante do PicassoIA para a própria cena. Crie imagens fixas com um modelo de texto para imagem, como o Seedream 4.5, anime-as com o Seedance 2.0 e componha a trilha do resultado com o MiniMax Music 2.6. Imagem, vídeo e áudio ficam no mesmo lugar, então você pode experimentar livremente sem fazer malabarismo com cinco ferramentas diferentes. Comece com um único prompt e veja como rapidamente um clipe mudo vira algo que você quer assistir.