O som de foley é a arquitetura invisível de todo filme que você já amou. Aqueles passos sobre o asfalto molhado, o rangido de uma jaqueta de couro, o baque satisfatório de uma porta se fechando numa cena de tensão, nada disso veio do microfone da câmera. Alguém gravou separadamente, à mão, em um estúdio. Esse processo sempre exigiu um espaço dedicado, equipamento caro e anos de ofício. A IA acabou de eliminar as três barreiras.
Gerar sons de foley realistas a partir de um prompt de texto agora é possível em menos de dois minutos. Ferramentas como o Stable Audio 2.5 conseguem produzir passos sobre cascalho, chuva batendo em um telhado de zinco ou a batida oca de nós dos dedos em madeira a partir de uma descrição simples. Isso não é um atalho para a mediocridade. É um atalho para áudio de qualidade profissional, que antes exigia uma sessão em uma instalação de pós-produção.
Este artigo mostra exatamente como fazer isso: o que é foley, quais modelos de IA produzem os melhores resultados, como escrever prompts que gerem sons críveis e como sincronizar tudo com suas imagens sem software caro.
O que o som de foley realmente faz
O termo "foley" vem de Jack Foley, um artista de som da Universal Studios que pioneirou a técnica na década de 1920. Ele descobriu que gravar som ao vivo em um set de filmagem era pouco confiável: vento, ruído mecânico e interferências do ambiente tornavam quase impossível obter um áudio limpo. Sua solução foi recriar cada som do zero em um ambiente de estúdio controlado.
Essa prática nunca parou. Ainda é assim que Hollywood faz em 2027.
As 3 categorias de foley
O trabalho profissional de foley se divide em três categorias distintas, cada uma com uma função emocional específica em uma cena:
| Categoria | Exemplos | Finalidade |
|---|
| Passos | Sapatos sobre azulejo, botas sobre cascalho, pés descalços sobre madeira | Situa os personagens no espaço |
| Movimento | Farfalhar de roupas, rangido de couro, roçar de tecido | Adiciona presença física |
| Efeitos específicos | Batidas em portas, manuseio de objetos de cena, tilintar de vidro | Pontua momentos-chave da história |
Ferramentas de IA conseguem gerar as três com diferentes níveis de precisão. Passos e efeitos específicos são hoje onde a IA se sai melhor: os sons são consistentes, controláveis e limpos.
Por que isso importa mais do que você imagina
O cérebro humano é extraordinariamente sensível a descompassos de áudio. Assista a qualquer cena com passos levemente fora de sincronia e seu subconsciente percebe na hora, mesmo que você não consiga dizer por que a cena "parece errada". É por isso que um áudio ruim degrada a qualidade percebida do vídeo mais do que imagens ruins. O público perdoa uma câmera tremida. Não perdoa um áudio que quebra a imersão.
💡 Pesquisas sobre percepção em cinema mostram de forma consistente que a qualidade do áudio afeta a forma como o público avalia o valor de produção geral, mais do que a iluminação, a correção de cor ou até a atuação.
Isso significa que adicionar um foley bem feito não é opcional se você quer que seu trabalho seja levado a sério. É o mínimo necessário.

Entender o que mudou ajuda você a usar as novas ferramentas de forma mais inteligente.
O que você costumava precisar
O foley tradicional exigia:
- Um estúdio de foley: Uma sala com vários tipos de piso (azulejo, madeira, cascalho, carpete) para gravar diferentes sons de passos
- Um artista de foley: Alguém treinado para executar sons sincronizados com a imagem, um ofício especializado e caro
- Equipamento de gravação: Microfones de alta qualidade, pré-amplificadores, uma interface de áudio e um ambiente acústico silencioso
- Uma DAW: Software de estação de trabalho de áudio digital, como Pro Tools, Logic ou Reaper, para gravar, editar e processar
- Tempo: Um único curta-metragem de 3 minutos pode exigir de 4 a 6 horas de gravação e edição de foley
A barreira do custo, por si só, deixava o bom design de som fora do alcance de criadores independentes.
O que a IA muda
Ferramentas de IA invertem tudo isso. Você digita uma descrição do som que precisa. O modelo gera um arquivo de áudio limpo. Você o arrasta para sua linha do tempo. O processo inteiro para um único som leva de dois a cinco minutos.
O que a IA ainda não substitui: o foley baseado em performance, em que um artista treinado assiste à imagem e executa os sons em perfeita sincronia. Para esse nível de precisão, artistas humanos de foley continuam essenciais. Mas, para a grande maioria das produções independentes, o áudio gerado por IA é indistinguível de gravações de biblioteca e, muitas vezes, melhor do que gravações de campo de baixa qualidade.

A ferramenta de IA certa para efeitos sonoros
Nem todos os modelos de áudio com IA são construídos da mesma forma. Alguns se concentram em composição musical, outros em síntese de voz, e um grupo menor se destaca especificamente em sons ambientais e do tipo foley.
Stable Audio 2.5 para foley
O Stable Audio 2.5, da Stability AI, é atualmente uma das opções mais fortes para gerar efeitos sonoros e áudio de foley a partir de texto. Diferentemente dos modelos focados em música, ele lida com:
- Texturas e ambientes: Chuva, vento, ondas do mar, murmúrio de multidão
- Sons mecânicos e percussivos: Portas batendo, impactos de metal, passos sobre superfícies específicas
- Efeitos curtos e precisos: O clique de um interruptor, um vidro quebrando, chaves tilintando
O modelo permite controlar a duração, o que importa muito para o trabalho de foley. Você precisa que um loop de passos tenha exatamente o tamanho certo para sincronizar com uma sequência de caminhada.
💡 O Stable Audio 2.5 aceita prompts que especificam material da superfície, intensidade, distância e ambiente acústico. Use todos esses parâmetros no seu prompt para obter os resultados mais precisos.
Outros modelos que valem a pena
Além do Stable Audio, vários outros modelos da plataforma do PicassoIA contribuem para um fluxo de trabalho sólido de design de som:
- ElevenLabs Music: Melhor para trilhas atmosféricas e bases ambientes que ficam sob a sua camada de foley
- Google Lyria 3: Forte para gerar composições musicais completas que acompanham cenas
- Minimax Music 2.6: Excelente para gerar rapidamente faixas de fundo alinhadas ao clima da cena
Para narração em voz over que possa acompanhar seu projeto, o ElevenLabs V3 e o Minimax Speech 2.8 HD produzem voz de qualidade de estúdio a partir de texto.

Como usar o Stable Audio 2.5 no PicassoIA
Aqui está o fluxo de trabalho exato para gerar sons de foley com o Stable Audio 2.5.
Passo 1: escreva um prompt de som específico
A qualidade do resultado depende quase inteiramente da qualidade da descrição de entrada. Prompts vagos produzem sons vagos. Prompts específicos produzem sons específicos.
Prompt fraco: "passos"
Prompt forte: "Passos lentos e deliberados de sapatos sociais de couro caminhando sobre paralelepípedos molhados, leve eco das paredes de tijolo ao redor, reverberação moderada, gravado de perto, ritmo médio, sem música"
A diferença de qualidade entre esses dois prompts é dramática. A especificidade do material, da superfície, do espaço acústico e do ritmo influencia toda a construção do som pelo modelo.
Passo 2: defina a duração e o espaço acústico
O Stable Audio 2.5 permite especificar a duração do áudio gerado. Para o trabalho de foley:
- Efeitos curtos e pontuais (batida na porta, quebra de vidro): de 1 a 3 segundos
- Loops de passos: de 8 a 15 segundos, que você pode repetir ou estender no seu DAW
- Bases ambientes (chuva, vento, multidão): de 30 a 60 segundos para ter variedade antes que a repetição fique óbvia
O ambiente acústico no seu prompt importa tanto quanto o próprio som. Um som gravado em uma "igreja grande de pedra com reverberação longa" vai soar completamente diferente do mesmo som "gravado seco em uma câmara anecoica". Combine a acústica com o ambiente visual.
Passo 3: baixe e sincronize
Depois de gerado, baixe o arquivo de áudio e importe-o para o seu software de edição. A maioria dos editores padrão, como DaVinci Resolve, Adobe Premiere e Final Cut Pro, lida com isso nativamente. A partir daí:
- Coloque o clipe de áudio em uma trilha de foley dedicada, separada do áudio de produção
- Alinhe visualmente o som à ação usando os picos da forma de onda como pontos de referência
- Ajuste o volume e aplique um filtro passa-alta em torno de 80Hz para remover o ronco de baixa frequência
- Adicione uma reverberação de ambiente sutil se o som gerado estiver seco demais para o seu ambiente visual

Prompts que realmente funcionam
É aqui que a maioria das pessoas trava. Escrever prompts de som eficazes é uma habilidade, mas segue um padrão repetível.
A fórmula para prompts de som
Todo prompt de foley forte contém cinco elementos:
[Sujeito] + [Ação/Material] + [Superfície/Ambiente] + [Espaço acústico] + [Clima/Intensidade]
Veja a decomposição de um exemplo:
- Sujeito: "Botas de trabalho pesadas"
- Ação/Material: "caminhando em ritmo lento sobre cascalho seco"
- Superfície/Ambiente: "cenário rural ao ar livre"
- Espaço acústico: "céu aberto, reverberação mínima, vento leve ao fundo"
- Clima/Intensidade: "tenso, deliberado, isolado"
Combinado: "Botas de trabalho pesadas caminhando em ritmo lento e deliberado sobre cascalho seco em um cenário rural aberto, reverberação mínima, ambiente com vento leve, atmosfera tensa e isolada, sem música"
10 prompts prontos para usar
Copie estes diretamente no Stable Audio 2.5:
Bare feet walking slowly on old wooden floorboards, slight creak on each step, quiet interior room, dry acoustic, warm atmosphere, no music
Heavy rain falling on a metal tin roof, continuous texture, medium intensity, no thunder, interior recording perspective, no music
Single wooden door closing firmly, hollow resonance, medium-sized room, moderate reverb, no music
Glass of ice water being placed on a hard wooden table, short transient, slight clink, dry room acoustic, no music
Car keys jangling in a hand, close-up recording, 2-second clip, dry acoustic, no background noise
Dry autumn leaves crunching underfoot with each footstep, outdoor setting, light breeze, open air acoustic, no music
Fire crackling in a stone fireplace, warm and steady, close recording, no music, soft ambient atmosphere
Knuckles knocking firmly on a solid wood door three times, medium room, moderate reverb, no music
Typing on a mechanical keyboard at medium pace, close recording, dry room acoustic, slight room tone, no music
Ocean waves rolling onto pebble beach, rhythmic and steady, outdoor recording, natural wind ambience, calming, no music
💡 Sempre adicione "sem música" aos seus prompts. Sem essa instrução, alguns modelos misturam elementos musicais aos efeitos sonoros por padrão.

Gerar bons sons é só metade do trabalho. Posicioná-los corretamente é o que cria a ilusão.
O método de sincronização em 3 passos
1. Use uma trilha de referência primeiro. Antes de refinar o áudio, coloque sons provisórios em cada momento que precisa de foley. Isso dá a você uma visão completa de quantos sons são necessários antes de gerar qualquer coisa.
2. Sincronize com os picos visuais. Todo som tem um gatilho visual: o quadro em que o pé toca o chão, o quadro em que a mão toca uma superfície. Use a função de zoom do seu editor para chegar ao nível de quadro exato e alinhe o transiente do seu áudio (o ataque inicial e abrupto do som) a esse quadro.
3. Sobreponha camadas, não substitua. O design de som profissional é sempre em múltiplas camadas. Um único passo sobre cascalho pode, na verdade, ser três sons empilhados: o transiente do impacto, uma cauda curta de pedrinhas raspando e um som de ambiente de sala quase imperceptível. Os sons gerados por IA costumam ser uma única camada. Adicione um ambiente sutil por baixo para preencher o espaço.
Erros comuns que quebram a imersão
- Repetir o mesmo clipe: Se você usar o mesmo som de passo 40 vezes seguidas, o público percebe. Gere de 3 a 4 variações e alterne entre elas.
- Ignorar mudanças de superfície: Um personagem que anda do carpete para a madeira precisa de dois sons completamente diferentes no ponto de transição.
- Espaço acústico errado: Se a sua imagem é uma cena de cidade ao ar livre, mas o foley soa como se tivesse sido gravado em um banheiro, a incoerência fica evidente na hora. Combine a reverberação com o ambiente visual.
- Alto demais: O foley deve ficar abaixo do diálogo, não competir com ele. Um ponto de partida de -18 a -20 dBFS para passos é padrão na mixagem para transmissão.

Cineastas independentes com orçamento limitado
Um curta-metragem com 15 minutos de material pode exigir de 200 a 400 sons de foley individuais. Contratar um artista de foley e tempo de estúdio para gravar tudo isso de forma tradicional custaria entre US$ 1.500 e US$ 5.000 na maioria dos mercados. Gerá-los com IA custa uma fração disso e pode ser feito da noite para o dia por uma pessoa com um notebook.
O controle criativo também é significativo. Quando você é diretor, editor e designer de som ao mesmo tempo, poder iterar rapidamente sobre escolhas de áudio sem remarcar o estúdio é uma vantagem considerável.
YouTubers e criadores de conteúdo
Muitos canais do YouTube atuam em gêneros nos quais a qualidade do áudio de produção é um sinal direto de profissionalismo: documentário, viagem, culinária, conteúdo educativo. Adicionar foley a imagens de cobertura (b-roll), como o som de uma faca cortando legumes, passos atravessando um mercado ou mãos folheando papel, eleva imediatamente o valor de produção percebido, sem exigir uma equipe de produção.
💡 Para conteúdo do YouTube com apresentador falando para a câmera, mesmo adicionar um tom de sala sutil e foley ambiente sob as sequências de b-roll melhora muito a sensação de continuidade entre os cortes.
Podcasts e produção de áudio
Embora os podcasts tradicionais não usem foley no sentido cinematográfico, podcasts narrativos, dramas em áudio e programas em estilo documentário se beneficiam enormemente de design de som gerado por IA. As mesmas ferramentas e o mesmo fluxo de trabalho se aplicam: prompts específicos, duração controlada, sobreposição de camadas para criar profundidade.
O ElevenLabs Music e o Google Lyria 3 combinam bem com o Stable Audio para esse caso de uso, unindo bases musicais atmosféricas a efeitos de foley precisos.


Monte sua própria biblioteca de sons agora
A coisa mais valiosa que você pode fazer agora é começar a montar uma biblioteca pessoal de sons. Sempre que gerar um som de foley de que goste, salve-o com um nome de arquivo descritivo. Com o tempo, você acumula uma coleção de sons ajustados à sua estética específica, gerados no nível de qualidade que você validou e prontos para usar em qualquer projeto futuro.
Comece pelo básico: passos internos (pés descalços, sapatos, botas), passos externos (grama, cascalho, concreto), três ou quatro ambientes sonoros (tom de sala interna, brisa leve ao ar livre, chuva, fundo de cidade) e alguns efeitos pontuais (batida na porta, fechar a porta, tilintar de vidro, manuseio de papel).
Essa biblioteca básica de 20 a 30 sons cobre a maior parte das necessidades cotidianas de produção para a maioria dos criadores.
O Stable Audio 2.5 é por onde começar. Abra o modelo no PicassoIA, cole um dos 10 prompts acima e gere seu primeiro som. Depois ajuste o prompt, gere de novo e compare. Em menos de uma hora, você terá uma compreensão prática de como o modelo responde a descrições diferentes e uma pilha de arquivos de áudio utilizáveis para o seu próximo projeto.
Seu próximo vídeo não precisa soar como se tivesse sido filmado no vácuo. As ferramentas existem, funcionam e estão disponíveis agora mesmo.
