Una presentación de diez diapositivas debería llevarte una tarde. La narración te ocupa el resto de la semana. Grabas la diapositiva 3, ladra un perro, la vuelves a grabar, y luego detectas un nombre de producto mal pronunciado en la diapositiva 7 y el tono de las diapositivas 1 a 6 ya no encaja. La voz en off con IA para PowerPoint, Premiere Pro y DaVinci Resolve elimina ese bucle: escribes el guion una vez, generas audio limpio para cada diapositiva o escena y añades los archivos al editor que ya usas.
Este artículo recorre todo el proceso. Elegirás un modelo de voz, escribirás un guion que suene hablado y no leído, lo ejecutarás en PicassoIA y después conectarás el audio en PowerPoint, Premiere Pro y DaVinci Resolve con rutas de menú y ajustes concretos. El resultado es un flujo de trabajo repetible para presentaciones de formación, videos de YouTube, demos de productos y presentaciones para clientes, y nada de esto necesita un micrófono.
Elige el modelo de voz adecuado
No todos los modelos de texto a voz sirven para cualquier trabajo. Una voz que suena perfecta en un recorrido tranquilo por un producto puede resultar plana en una promo dinámica de 30 segundos. PicassoIA tiene 24 modelos de texto a voz, así que la pregunta útil es cuáles dos o tres necesitas de verdad.

Modelos lado a lado
Así se comparan las opciones más útiles para narrar diapositivas y videos:
| Modelo | Ideal para | Rasgo destacado |
|---|
| Speech 2.8 HD | Narración de diapositivas, tutoriales, guiones largos | Diez estilos de emoción, exportación en WAV y FLAC, marcas de pausa en línea, más de 40 idiomas |
| Speech 2.8 Turbo | Borradores rápidos y reescrituras veloces | Velocidad ante todo, de la misma familia que 2.8 HD |
| ElevenLabs V3 | Narración expresiva y lecturas de personajes | Más de 25 personalidades de voz, controles deslizantes de estilo y estabilidad |
| ElevenLabs v2 Multilingual | Un guion en muchos idiomas | Más de 30 idiomas |
| Gemini 3.1 Flash TTS | Lanzamientos globales | 30 voces, más de 70 idiomas |
| Qwen3 TTS | Voces personalizadas o clonadas | Clona una voz o diseña una nueva |
Elige un modelo por proyecto y mantenlo. Mezclar tres voces distintas en una misma presentación hace que el público se fije en el audio en lugar de en el mensaje.
💡 Consejo: Genera el mismo párrafo de 20 segundos con tres modelos, reprodúcelos uno tras otro con auriculares y elige antes de tocar el guion real. Cinco minutos de prueba te ahorran un render completo más adelante.
Clonar tu propia voz
Si la presentación debe sonar como tú, o como el portavoz de tu empresa, Voice Cloning crea una voz personalizada que puedes reutilizar. El ID de voz que devuelve se conecta directamente a Speech 2.8 HD, así que cada diapositiva posterior mantiene el mismo sonido. Qwen3 TTS ofrece una ruta similar si prefieres diseñar una voz a partir de una descripción. Clona solo voces que te pertenezcan o para las que tengas permiso por escrito.

Escribe un guion que suene hablado
El texto a voz lee exactamente lo que le das. Un guion escrito para la vista produce una narración rígida, así que edítalo para el oído antes de generar nada.

Números, siglas y pausas
Unos cuantos hábitos corrigen la mayoría de los momentos robóticos:
- Usa frases cortas. Apunta a entre 15 y 20 palabras. Si te quedas sin aire al leerla en voz alta, el modelo también sonará apresurado.
- Escribe los términos difíciles tal como suenan. Escribe "S Q L" si quieres las letras y "sequel" si quieres la palabra.
- Activa English Normalization en Speech 2.8 HD cuando el guion tenga fechas, precios o números grandes.
- Añade marcas de pausa. Escribir
<#0.5#> inserta medio segundo de silencio, ideal justo después de un cambio de diapositiva.
- Lee el guion en voz alta una vez tú mismo. Todo lo que te haga trabarte hará que el modelo también se trabe.
La narración se mueve a unas 150 palabras por minuto, o alrededor de 2,5 palabras por segundo. Usa esta tabla para calcular cada diapositiva antes de escribirla:
| Duración de la diapositiva o escena | Número de palabras objetivo |
|---|
| 10 segundos | Unas 25 palabras |
| 20 segundos | Unas 50 palabras |
| 30 segundos | Unas 75 palabras |
| 60 segundos | Unas 150 palabras |
Un archivo por diapositiva o escena
Genera cada diapositiva como un archivo de audio independiente y nómbralos en orden: slide-01.wav, slide-02.wav y así sucesivamente. Cuando un cliente cambie el texto de la diapositiva 6, regeneras un solo archivo en lugar de volver a renderizar toda la narración, y cada una de las demás diapositivas conserva su tiempo exacto. La misma regla se aplica al video: un archivo por escena, en el orden de tu línea de tiempo.
Usa Speech 2.8 HD en PicassoIA
Speech 2.8 HD es el caballo de batalla de este flujo de trabajo porque exporta audio sin pérdida, admite pausas en línea y te da control directo sobre la emoción y la velocidad.

Paso 1: Pega tu guion
Abre la página del modelo y pega la narración de una diapositiva en el campo Text. Una ejecución admite hasta 10.000 caracteres, mucho más de lo que necesita cualquier diapositiva. Añade ahora tus marcas de pausa.
Paso 2: Ajusta voz, emoción y velocidad
Estos son los ajustes que importan para obtener audio listo para el editor:
| Ajuste | Valor recomendado | Por qué |
|---|
| Voice ID | Wise_Woman (por defecto) o una voz explicativa como English_Explanatory_Man | Entrega clara y constante |
| Emotion | calm o neutral para formación, auto para marketing | Mantiene el tono coherente |
| Speed | De 0,95 a 1,05 | El rango permitido va de 0,5 a 2,0, pero los cambios pequeños suenan naturales |
| Pitch | 0 | El rango va de menos 12 a más 12 semitonos |
| Language boost | English o Automatic | Ayuda con nombres y términos extranjeros |
| English normalization | Activada para números y fechas | Añade un poco de latencia |
| Audio format | WAV | Sin pérdida, aceptado por cualquier editor |
| Sample rate | 44100 | La opción más alta disponible |
| Channel | mono | Una voz necesita un solo canal |
| Subtitle enable | Activado si quieres subtítulos | Devuelve marcas de tiempo por frase |
Paso 3: Genera, escucha, descarga
Ejecuta el modelo y escucha con auriculares. Cambia un ajuste a la vez: si la línea suena demasiado entusiasta, cambia la emoción antes de tocar la velocidad. Cuando suene bien, descarga el archivo y renómbralo para que coincida con su diapositiva.
Tres errores aparecen una y otra vez. Generar una presentación entera como un único archivo largo hace que las ediciones posteriores sean dolorosas. Subir la Speed a 1,3 para encajar en una diapositiva apretada hace que la voz suene apresurada, así que es mejor recortar palabras. Y saltarse la escucha con auriculares deja pasar pequeños errores de pronunciación hasta la exportación final. Dedica ese minuto extra por diapositiva y la fase de edición será fluida.
💡 Consejo para ElevenLabs V3: ElevenLabs V3 tiene los campos Previous Text y Next Text. Pega la diapositiva anterior y la siguiente, y el modelo ajusta la entonación en los límites para que la voz fluya de una diapositiva a otra.
Voz en off con IA para PowerPoint
PowerPoint es el lugar más rápido para ver el resultado. Una presentación narrada se puede compartir como video, reproducir en un quiosco o enviar a personas que nunca se unirán a una llamada en directo.

Añade el audio a cada diapositiva
- Selecciona la primera diapositiva en el panel de miniaturas.
- Elige Insertar, luego Audio, luego Audio en mi PC y selecciona
slide-01.wav.
- En la pestaña Reproducción, fija Inicio en Automáticamente y marca Ocultar durante la presentación para que no aparezca el icono del altavoz.
- Haz clic en Recortar audio para leer la duración exacta del clip.
- En la pestaña Transiciones, marca Después en Avanzar diapositiva y escribe esa duración, más medio segundo de margen.
- Repite con todas las diapositivas.
Ahora el audio empieza solo, y la diapositiva avanza cuando termina la frase. No hace falta hacer clic durante la reproducción. Si una diapositiva tiene animaciones, configúralas en Inicio: Después de la anterior para que la secuencia de elementos avance al mismo ritmo que la voz en lugar de esperar un clic.
💡 Consejo: Para presentaciones que viajan por correo electrónico, exporta la narración desde Speech 2.8 HD como MP3 a 128 kbps en lugar de WAV. El archivo ocupa poco espacio y nadie notará la diferencia en los altavoces de un equipo portátil.
Exporta un video narrado
Ve a Archivo, luego Exportar, luego Crear un video. Elige Full HD (1080p), deja seleccionada la opción Usar tiempos y narraciones grabados y haz clic en Crear video. PowerPoint respeta los tiempos de avance que escribiste, así que el video coincide con el audio segundo a segundo.
Voz en off con IA en Premiere Pro
En una edición de video, la voz es tu ancla. El audio de IA nunca cambia de ritmo entre tomas, así que puedes fijar primero la narración y cortar las imágenes para que coincidan con ella.

Importa y sincroniza con la línea de tiempo
- Pulsa Ctrl+I (Cmd+I en Mac) e importa todos los archivos de voz en un contenedor llamado VO.
- Arrastra
scene-01.wav a A1 al inicio de la secuencia y luego coloca los siguientes archivos uno detrás de otro.
- Usa la herramienta de cuchilla (C) y el borrado de desplazamiento (ripple delete) para cerrar cualquier hueco más largo de lo que quieres.
- Pulsa M en las palabras exactas donde debe cambiar una imagen y corta tu metraje en esos marcadores.
Premiere ajusta automáticamente los archivos de 44,1 kHz a la secuencia de 48 kHz, así que no necesitas remuestrear nada a mano.
Limpia el audio con Essential Sound
Abre Ventana, luego Essential Sound, selecciona los clips de voz y haz clic en Diálogo. En Sonoridad, pulsa Auto-Match. Pon la música en su propia pista, etiquétala como Música y activa Ducking frente a los clips de diálogo para que la banda sonora baje cada vez que habla la voz. Si alguna S suena aguda, añade el efecto DeEsser a la pista de voz.
| Pista | Contenido | Objetivo |
|---|
| A1 | Voz en off con IA | Etiquetada como Diálogo, Auto-Match |
| A2 | Música | Etiquetada como Música, con ducking bajo A1 |
| A3 | Efectos de sonido | Bajos en la mezcla, nunca más fuertes que la voz |
| Mezcla final | Secuencia completa | Alrededor de menos 14 LUFS para video web |
💡 Consejo: Si una línea suena mal, no la arregles con complementos. Edita el texto, regenera ese único archivo con los mismos ajustes y cámbialo en la línea de tiempo. Lleva menos tiempo que corregirlo a oído.
Voz en off con IA en DaVinci Resolve
Resolve premia el mismo enfoque. Fija la voz y construye todo lo demás a su alrededor. La versión gratuita de Resolve basta para todos los pasos siguientes.

Construye la edición en la página Edit
- Pulsa Ctrl+I o arrastra tus archivos de voz al Media Pool.
- En la página Edit, suelta cada archivo en Audio 1 siguiendo el orden de las escenas.
- Pulsa B para la herramienta Blade y recorta el silencio al inicio y al final de cada clip, después cierra los huecos con un borrado de desplazamiento (ripple delete).
- Pulsa M para colocar marcadores en la línea de tiempo en las palabras donde debe cambiar la imagen.
Resolve remuestrea por sí mismo los archivos de 44,1 kHz a la línea de tiempo de 48 kHz.
Equilibra los niveles en Fairlight
Cambia a la página Fairlight. Haz clic con el botón derecho sobre los clips de voz y elige Normalize Audio Levels para que todas las escenas queden con la misma sonoridad. Revisa el resultado en el medidor de sonoridad y ajusta el bus Main 1 hasta que la línea de tiempo terminada quede cerca de menos 14 LUFS para entrega web. Para la música, puedes subir y bajar el volumen a mano con automatización o usar un compresor en la pista musical con la voz como sidechain.
Así se alinean las tres herramientas en las mismas tareas:
| Tarea | PowerPoint | Premiere Pro | DaVinci Resolve |
|---|
| Importar audio | Insertar, Audio, Audio en mi PC | Archivo, Importar | Archivo, Importar, Media |
| Mejor formato de archivo | MP3 a 128 kbps | WAV | WAV |
| Método de sincronización | Avanzar diapositiva, Después | Herramienta de cuchilla y borrado de desplazamiento | Herramienta Blade y borrado de desplazamiento |
| Igualación de niveles | Volumen de reproducción | Essential Sound, Auto-Match | Normalize Audio Levels en Fairlight |
| Exportar | Crear un video | Exportar (Ctrl+M) | Página Deliver |
Subtítulos, doblaje y elementos visuales
La voz en off es solo una parte de la pieza terminada. El mismo guion alimenta los subtítulos, las traducciones y las imágenes en pantalla.

Subtítulos y doblaje a partir de un solo guion
Para los subtítulos, activa los metadatos de subtítulos en Speech 2.8 HD para obtener marcas de tiempo por frase, o pasa el audio final por GPT-4o Transcribe para obtener una transcripción, y después incrusta los subtítulos en un clip exportado con Autocaption.
Para otros idiomas, tienes dos rutas limpias:
Para añadir una nueva pista de voz a un MP4 existente sin abrir un editor, Video Audio Merge reemplaza o mezcla la banda sonora.
Elementos visuales de diapositivas e imágenes de cobertura
Una gran narración sobre imágenes flojas sigue perdiendo al público. Genera imágenes fotográficas fijas para tus diapositivas y planos de cobertura con un modelo de texto a imagen: P Image es rápido para borradores, mientras que Seedream 4.5 y FLUX.2 Pro encajan en imágenes principales. Describe el objetivo, la luz y las texturas de las superficies, y fija la relación de aspecto en 16:9 para que la imagen llene una diapositiva o un fotograma de la línea de tiempo sin recortes.

Pruébalo en tu próximo proyecto
Elige la presentación o el video que llevas tiempo posponiendo grabar. Pega su primera diapositiva en Speech 2.8 HD en PicassoIA, pulsa ejecutar y arrastra el archivo a PowerPoint, Premiere Pro o DaVinci Resolve. Después genera la siguiente diapositiva con otra voz y compara. Al llegar al tercer archivo sabrás qué voz encaja con tu contenido y qué ajustes no vuelves a tocar nunca.
Todo este flujo de trabajo vive en un solo lugar: voces, transcripción, subtítulos, doblaje y generación de imágenes. Explora el catálogo completo en picassoia.com/en/all-models, prueba dos o tres voces con tu propio guion y deja que tu próxima presentación se narre sola.