Uma apresentação de dez slides deveria levar uma tarde. A narração toma o resto da semana. Você grava o slide 3, um cachorro late, você grava de novo, e aí percebe que um nome de produto foi mal pronunciado no slide 7 e que o tom dos slides 1 a 6 já não combina. A locução com IA para PowerPoint, Premiere Pro e DaVinci Resolve elimina esse ciclo: você escreve o roteiro uma vez, gera um áudio limpo para cada slide ou cena e coloca os arquivos no editor que você já usa.
Este artigo acompanha o caminho completo. Você vai escolher um modelo de voz, escrever um roteiro que soe falado e não lido, executá-lo no PicassoIA e depois levar o áudio para o PowerPoint, o Premiere Pro e o DaVinci Resolve, com caminhos de menu e configurações específicos. O resultado é um fluxo de trabalho repetível para apresentações de treinamento, vídeos para o YouTube, demonstrações de produtos e apresentações para clientes, e nada disso exige um microfone.
Escolha o modelo de voz certo
Nem todo modelo de texto para fala serve para qualquer trabalho. Uma voz que soa perfeita numa demonstração calma de produto pode parecer sem vida numa promo de 30 segundos cheia de energia. O PicassoIA lista 24 modelos de texto para fala, então a pergunta útil é de quais dois ou três você realmente precisa.

Modelos lado a lado
Veja como as opções mais úteis se comparam para narração de slides e vídeos:
| Modelo | Melhor para | Diferencial |
|---|
| Speech 2.8 HD | Narração de slides, tutoriais, roteiros longos | Dez estilos de emoção, exportação em WAV e FLAC, marcadores de pausa inline, mais de 40 idiomas |
| Speech 2.8 Turbo | Rascunhos rápidos e reescritas ágeis | Velocidade em primeiro lugar, mesma família do 2.8 HD |
| ElevenLabs V3 | Narração expressiva e leituras de personagens | Mais de 25 personas de voz, controles de estilo e estabilidade |
| ElevenLabs v2 Multilingual | Um roteiro em muitos idiomas | Mais de 30 idiomas |
| Gemini 3.1 Flash TTS | Lançamentos globais | 30 vozes, mais de 70 idiomas |
| Qwen3 TTS | Vozes personalizadas ou clonadas | Clone uma voz ou crie uma nova |
Escolha um modelo por projeto e mantenha-o. Misturar três vozes diferentes numa mesma apresentação faz o público perceber o áudio em vez da mensagem.
💡 Dica: Gere o mesmo parágrafo de 20 segundos com três modelos, ouça-os em sequência com fones de ouvido e escolha antes de mexer no roteiro real. Cinco minutos aqui economizam uma renderização completa depois.
Clonando a sua própria voz
Se a apresentação precisa soar como você, ou como o porta-voz da sua empresa, a Voice Cloning cria uma voz personalizada que você pode reutilizar. O ID de voz que ela devolve se encaixa direto no Speech 2.8 HD, então todos os slides seguintes mantêm o mesmo som. O Qwen3 TTS oferece um caminho parecido se você preferir criar uma voz a partir de uma descrição. Clone apenas vozes que sejam suas ou que você tenha autorização por escrito para usar.

Escreva um roteiro que soe falado
O texto para fala lê exatamente o que você entrega a ele. Um roteiro escrito para ser lido com os olhos produz uma narração dura, então edite para o ouvido antes de gerar qualquer coisa.

Números, siglas e pausas
Alguns hábitos resolvem a maioria dos momentos robóticos:
- Mantenha frases curtas. Busque de 15 a 20 palavras. Se você ficar sem fôlego lendo em voz alta, o modelo também vai soar apressado.
- Escreva termos difíceis do jeito que eles são falados. Escreva "S Q L" se quiser as letras, "sequel" se quiser uma palavra.
- Ative a English Normalization no Speech 2.8 HD quando o roteiro tiver datas, preços ou números grandes.
- Adicione marcadores de pausa. Digitar
<#0.5#> insere meio segundo de silêncio, o que é perfeito logo após uma troca de slide.
- Leia em voz alta uma vez você mesmo. Qualquer coisa que faça você tropeçar vai fazer o modelo tropeçar.
A narração corre a cerca de 150 palavras por minuto, ou cerca de 2,5 palavras por segundo. Use esta tabela para dimensionar cada slide antes de escrevê-lo:
| Duração do slide ou da cena | Número de palavras-alvo |
|---|
| 10 segundos | Cerca de 25 palavras |
| 20 segundos | Cerca de 50 palavras |
| 30 segundos | Cerca de 75 palavras |
| 60 segundos | Cerca de 150 palavras |
Um arquivo por slide ou cena
Gere cada slide como um arquivo de áudio próprio e nomeie-os em ordem: slide-01.wav, slide-02.wav, e assim por diante. Quando um cliente mudar o texto do slide 6, você regenera um único arquivo em vez de renderizar a narração inteira de novo, e todos os outros slides mantêm exatamente o mesmo tempo. A mesma regra vale para vídeo: um arquivo por cena, seguindo a ordem da sua linha do tempo.
Use o Speech 2.8 HD no PicassoIA
O Speech 2.8 HD é o carro-chefe deste fluxo de trabalho porque exporta áudio sem perdas, aceita pausas inline e oferece controle direto sobre emoção e velocidade.

Passo 1: cole o seu roteiro
Abra a página do modelo e cole a narração de um slide no campo Text. Uma execução aceita até 10.000 caracteres, muito mais do que qualquer slide precisa. Adicione agora os seus marcadores de pausa.
Passo 2: defina voz, emoção e velocidade
Estas são as configurações que importam para um áudio pronto para o editor:
| Configuração | Valor recomendado | Por quê |
|---|
| Voice ID | Wise_Woman (padrão) ou uma voz explicativa como English_Explanatory_Man | Entrega clara e constante |
| Emotion | calm ou neutral para treinamentos, auto para marketing | Mantém o tom consistente |
| Speed | 0,95 a 1,05 | A faixa permitida vai de 0,5 a 2,0, mas pequenas mudanças soam naturais |
| Pitch | 0 | A faixa vai de menos 12 a mais 12 semitons |
| Language boost | English ou Automatic | Ajuda com nomes e termos estrangeiros |
| English normalization | Ativada para números e datas | Adiciona um pouco de latência |
| Audio format | WAV | Sem perdas, aceito por qualquer editor |
| Sample rate | 44100 | A opção mais alta oferecida |
| Channel | mono | Uma voz precisa de um canal |
| Subtitle enable | Ativada se quiser legendas | Devolve timestamps por frase |
Passo 3: gere, ouça, baixe
Execute o modelo e depois ouça com fones de ouvido. Mude uma configuração por vez: se a fala soar animada demais, troque a emoção antes de mexer na velocidade. Quando soar bem, baixe o arquivo e renomeie-o para corresponder ao seu slide.
Três erros aparecem sempre. Gerar a apresentação inteira como um único arquivo longo torna as edições posteriores dolorosas. Subir a Speed para 1,3 para caber num slide apertado deixa a voz apressada, então corte palavras. E pular a escuta com fones de ouvido deixa pequenos deslizes de pronúncia chegarem à exportação final. Gaste o minuto extra por slide e a etapa de edição fica tranquila.
💡 Dica para o ElevenLabs V3: O ElevenLabs V3 tem os campos Previous Text e Next Text. Cole o slide anterior e o seguinte, e o modelo ajusta a entonação nas fronteiras para que a voz flua de um slide para o outro.
O PowerPoint é o lugar mais rápido para ver o resultado. Uma apresentação narrada pode ser compartilhada como vídeo, reproduzida num quiosque ou enviada a pessoas que nunca vão entrar numa chamada ao vivo.

Anexe o áudio a cada slide
- Selecione o primeiro slide no painel de miniaturas.
- Escolha Inserir, depois Áudio, depois Áudio no meu PC e selecione
slide-01.wav.
- Na guia Reprodução, defina Início como Automaticamente e marque Ocultar durante a apresentação para que nenhum ícone de alto-falante apareça.
- Clique em Cortar áudio para ler a duração exata do clipe.
- Na guia Transições, marque Após em Avançar slide e digite essa duração, mais meio segundo de respiro.
- Repita para cada slide.
O áudio agora começa sozinho, e o slide avança quando a frase termina. Nenhum clique é necessário durante a reprodução. Se um slide tiver animações, defina-as como Início: Após o anterior para que a sequência de construção acompanhe a voz em vez de esperar um clique.
💡 Dica: Para apresentações que viajam por e-mail, exporte a narração do Speech 2.8 HD como MP3 a 128 kbps em vez de WAV. O arquivo fica pequeno e ninguém percebe a diferença num alto-falante de notebook.
Exporte um vídeo narrado
Vá em Arquivo, depois Exportar, depois Criar um Vídeo. Escolha Full HD (1080p), mantenha Usar tempos e narrações gravados selecionado e clique em Criar Vídeo. O PowerPoint respeita os tempos de avanço que você digitou, então o vídeo fica igual ao áudio segundo a segundo.
Numa edição de vídeo, a voz é a sua âncora. O áudio de IA nunca muda de ritmo entre takes, então você pode travar primeiro a narração e depois cortar as imagens para acompanhá-la.

Importe e sincronize com a linha do tempo
- Pressione Ctrl+I (Cmd+I no Mac) e importe todos os arquivos de voz para uma pasta chamada VO.
- Arraste
scene-01.wav para A1 no início da sequência e depois coloque os próximos arquivos um após o outro.
- Use a ferramenta Lâmina (C) e a exclusão ripple para apertar qualquer intervalo maior do que você quer.
- Pressione M nas palavras exatas em que uma imagem deve mudar e depois corte o material nesses marcadores.
O Premiere ajusta automaticamente os arquivos de 44,1 kHz para a sequência de 48 kHz, então você não precisa reamostrar nada manualmente.
Limpe o áudio com o Essential Sound
Abra Janela, depois Essential Sound, selecione os clipes de voz e clique em Diálogo. Em Loudness, pressione Auto-Match. Coloque a música numa trilha própria, marque-a como Música e ative o Ducking em relação aos clipes de diálogo para que a trilha abaixe sempre que a voz falar. Se algum som de S soar agudo, adicione o efeito DeEsser à trilha de voz.
| Trilha | Conteúdo | Alvo |
|---|
| A1 | Locução com IA | Marcada como Diálogo, Auto-Match |
| A2 | Música | Marcada como Música, com ducking sob A1 |
| A3 | Efeitos sonoros | Baixos na mixagem, nunca mais altos que a voz |
| Mixagem final | Sequência inteira | Perto de menos 14 LUFS para vídeo na web |
💡 Dica: Se uma frase soar errada, não a conserte com plugins. Edite o texto, regenere apenas esse arquivo com as mesmas configurações e troque-o na linha do tempo. Leva menos tempo do que corrigir de ouvido.
O Resolve recompensa a mesma abordagem. Trave a voz e depois construa todo o resto em torno dela. A versão gratuita do Resolve basta para todas as etapas abaixo.

Monte a edição na página Edit
- Pressione Ctrl+I ou arraste os seus arquivos de voz para o Media Pool.
- Na página Edit, solte cada arquivo em Audio 1 na ordem das cenas.
- Pressione B para a ferramenta Blade cortar o silêncio no início e no fim de cada clipe, depois feche as lacunas com uma exclusão ripple.
- Pressione M para colocar marcadores na linha do tempo nas palavras em que a imagem deve mudar.
O Resolve reamostra sozinho os arquivos de 44,1 kHz para a linha do tempo de 48 kHz.
Equilibre os níveis no Fairlight
Mude para a página Fairlight. Clique com o botão direito nos clipes de voz e escolha Normalize Audio Levels para que cada cena fique no mesmo volume. Confira o resultado no medidor de loudness e ajuste o barramento Main 1 até que a linha do tempo finalizada fique perto de menos 14 LUFS para entrega na web. Para a música, você controla o volume manualmente com automação ou usa um compressor na trilha musical, com a voz como sidechain.
Veja como as três ferramentas se comparam nas mesmas tarefas:
| Tarefa | PowerPoint | Premiere Pro | DaVinci Resolve |
|---|
| Importar áudio | Inserir, Áudio, Áudio no meu PC | Arquivo, Importar | Arquivo, Importar, Mídia |
| Melhor formato de arquivo | MP3 a 128 kbps | WAV | WAV |
| Método de tempo | Avançar slide, Após | Ferramenta Lâmina e exclusão ripple | Ferramenta Blade e exclusão ripple |
| Equilíbrio de níveis | Volume de reprodução | Essential Sound, Auto-Match | Normalize Audio Levels no Fairlight |
| Exportação | Criar um Vídeo | Exportar (Ctrl+M) | Página Deliver |
Legendas, dublagem e imagens
A locução é só parte da peça final. O mesmo roteiro alimenta legendas, traduções e as imagens na tela.

Legendas e dublagem a partir de um único roteiro
Para legendas, ative os metadados de legenda no Speech 2.8 HD para obter timestamps por frase, ou rode o áudio final pelo GPT-4o Transcribe para obter uma transcrição e depois insira as legendas num clipe exportado com o Autocaption.
Para outros idiomas, você tem duas rotas limpas:
Para anexar uma nova faixa de voz a um MP4 existente sem abrir um editor, o Video Audio Merge substitui ou mistura a trilha sonora.
Imagens para slides e fotos de cobertura
Uma ótima narração sobre imagens fracas ainda perde o público. Gere fotos para os seus slides e planos de cobertura com um modelo de texto para imagem: o P Image é rápido para rascunhos, enquanto o Seedream 4.5 e o FLUX.2 Pro servem para imagens de destaque. Descreva a lente, a luz e as texturas da superfície, e defina a proporção como 16:9 para que a imagem preencha um slide ou um quadro da linha do tempo sem cortes.

Experimente no seu próximo projeto
Escolha aquela apresentação ou vídeo que você vem deixando para depois. Cole o primeiro slide no Speech 2.8 HD no Picasso IA, clique em executar e coloque o arquivo no PowerPoint, no Premiere Pro ou no DaVinci Resolve. Depois gere o slide seguinte com outra voz e compare. Ao terceiro arquivo, você vai saber qual voz combina com o seu conteúdo e quais configurações nunca mais precisará tocar.
Tudo neste fluxo de trabalho fica num só lugar: vozes, transcrição, legendas, dublagem e geração de imagens. Explore o catálogo completo em picassoia.com/en/all-models, teste duas ou três vozes no seu próprio roteiro e deixe sua próxima apresentação narrar a si mesma.