Voz en off con IA para PowerPoint, Premiere Pro y DaVinci Resolve sin micrófono

Escribe el guion una vez, genera una narración limpia con una voz de IA e insértala en PowerPoint, Premiere Pro o DaVinci Resolve. Este artículo compara modelos de voz, muestra los ajustes exactos, las rutas de menú y los niveles de sonoridad objetivo, y después añade subtítulos, doblaje y elementos visuales para terminar el proyecto.

Voz en off con IA para PowerPoint, Premiere Pro y DaVinci Resolve sin micrófono
Cristian Da Conceicao
Fundador de Picasso IA

Una presentación de diez diapositivas debería llevarte una tarde. La narración te ocupa el resto de la semana. Grabas la diapositiva 3, ladra un perro, la vuelves a grabar, y luego detectas un nombre de producto mal pronunciado en la diapositiva 7 y el tono de las diapositivas 1 a 6 ya no encaja. La voz en off con IA para PowerPoint, Premiere Pro y DaVinci Resolve elimina ese bucle: escribes el guion una vez, generas audio limpio para cada diapositiva o escena y añades los archivos al editor que ya usas.

Este artículo recorre todo el proceso. Elegirás un modelo de voz, escribirás un guion que suene hablado y no leído, lo ejecutarás en PicassoIA y después conectarás el audio en PowerPoint, Premiere Pro y DaVinci Resolve con rutas de menú y ajustes concretos. El resultado es un flujo de trabajo repetible para presentaciones de formación, videos de YouTube, demos de productos y presentaciones para clientes, y nada de esto necesita un micrófono.

Elige el modelo de voz adecuado

No todos los modelos de texto a voz sirven para cualquier trabajo. Una voz que suena perfecta en un recorrido tranquilo por un producto puede resultar plana en una promo dinámica de 30 segundos. PicassoIA tiene 24 modelos de texto a voz, así que la pregunta útil es cuáles dos o tres necesitas de verdad.

Estudio de grabación casero vacío con un micrófono de condensador cubierto de polvo y paneles acústicos de espuma

Modelos lado a lado

Así se comparan las opciones más útiles para narrar diapositivas y videos:

ModeloIdeal paraRasgo destacado
Speech 2.8 HDNarración de diapositivas, tutoriales, guiones largosDiez estilos de emoción, exportación en WAV y FLAC, marcas de pausa en línea, más de 40 idiomas
Speech 2.8 TurboBorradores rápidos y reescrituras velocesVelocidad ante todo, de la misma familia que 2.8 HD
ElevenLabs V3Narración expresiva y lecturas de personajesMás de 25 personalidades de voz, controles deslizantes de estilo y estabilidad
ElevenLabs v2 MultilingualUn guion en muchos idiomasMás de 30 idiomas
Gemini 3.1 Flash TTSLanzamientos globales30 voces, más de 70 idiomas
Qwen3 TTSVoces personalizadas o clonadasClona una voz o diseña una nueva

Elige un modelo por proyecto y mantenlo. Mezclar tres voces distintas en una misma presentación hace que el público se fije en el audio en lugar de en el mensaje.

💡 Consejo: Genera el mismo párrafo de 20 segundos con tres modelos, reprodúcelos uno tras otro con auriculares y elige antes de tocar el guion real. Cinco minutos de prueba te ahorran un render completo más adelante.

Clonar tu propia voz

Si la presentación debe sonar como tú, o como el portavoz de tu empresa, Voice Cloning crea una voz personalizada que puedes reutilizar. El ID de voz que devuelve se conecta directamente a Speech 2.8 HD, así que cada diapositiva posterior mantiene el mismo sonido. Qwen3 TTS ofrece una ruta similar si prefieres diseñar una voz a partir de una descripción. Clona solo voces que te pertenezcan o para las que tengas permiso por escrito.

Auriculares de estudio apoyados en un escritorio de nogal junto a una libreta escrita a mano

Escribe un guion que suene hablado

El texto a voz lee exactamente lo que le das. Un guion escrito para la vista produce una narración rígida, así que edítalo para el oído antes de generar nada.

Vista cenital de un escritorio de roble con un guion impreso, un equipo portátil, café y un cronómetro

Números, siglas y pausas

Unos cuantos hábitos corrigen la mayoría de los momentos robóticos:

  • Usa frases cortas. Apunta a entre 15 y 20 palabras. Si te quedas sin aire al leerla en voz alta, el modelo también sonará apresurado.
  • Escribe los términos difíciles tal como suenan. Escribe "S Q L" si quieres las letras y "sequel" si quieres la palabra.
  • Activa English Normalization en Speech 2.8 HD cuando el guion tenga fechas, precios o números grandes.
  • Añade marcas de pausa. Escribir <#0.5#> inserta medio segundo de silencio, ideal justo después de un cambio de diapositiva.
  • Lee el guion en voz alta una vez tú mismo. Todo lo que te haga trabarte hará que el modelo también se trabe.

La narración se mueve a unas 150 palabras por minuto, o alrededor de 2,5 palabras por segundo. Usa esta tabla para calcular cada diapositiva antes de escribirla:

Duración de la diapositiva o escenaNúmero de palabras objetivo
10 segundosUnas 25 palabras
20 segundosUnas 50 palabras
30 segundosUnas 75 palabras
60 segundosUnas 150 palabras

Un archivo por diapositiva o escena

Genera cada diapositiva como un archivo de audio independiente y nómbralos en orden: slide-01.wav, slide-02.wav y así sucesivamente. Cuando un cliente cambie el texto de la diapositiva 6, regeneras un solo archivo en lugar de volver a renderizar toda la narración, y cada una de las demás diapositivas conserva su tiempo exacto. La misma regla se aplica al video: un archivo por escena, en el orden de tu línea de tiempo.

Usa Speech 2.8 HD en PicassoIA

Speech 2.8 HD es el caballo de batalla de este flujo de trabajo porque exporta audio sin pérdida, admite pausas en línea y te da control directo sobre la emoción y la velocidad.

Mano sobre el panel táctil de un equipo portátil con un editor de forma de onda de audio en pantalla

Paso 1: Pega tu guion

Abre la página del modelo y pega la narración de una diapositiva en el campo Text. Una ejecución admite hasta 10.000 caracteres, mucho más de lo que necesita cualquier diapositiva. Añade ahora tus marcas de pausa.

Paso 2: Ajusta voz, emoción y velocidad

Estos son los ajustes que importan para obtener audio listo para el editor:

AjusteValor recomendadoPor qué
Voice IDWise_Woman (por defecto) o una voz explicativa como English_Explanatory_ManEntrega clara y constante
Emotioncalm o neutral para formación, auto para marketingMantiene el tono coherente
SpeedDe 0,95 a 1,05El rango permitido va de 0,5 a 2,0, pero los cambios pequeños suenan naturales
Pitch0El rango va de menos 12 a más 12 semitonos
Language boostEnglish o AutomaticAyuda con nombres y términos extranjeros
English normalizationActivada para números y fechasAñade un poco de latencia
Audio formatWAVSin pérdida, aceptado por cualquier editor
Sample rate44100La opción más alta disponible
ChannelmonoUna voz necesita un solo canal
Subtitle enableActivado si quieres subtítulosDevuelve marcas de tiempo por frase

Paso 3: Genera, escucha, descarga

Ejecuta el modelo y escucha con auriculares. Cambia un ajuste a la vez: si la línea suena demasiado entusiasta, cambia la emoción antes de tocar la velocidad. Cuando suene bien, descarga el archivo y renómbralo para que coincida con su diapositiva.

Tres errores aparecen una y otra vez. Generar una presentación entera como un único archivo largo hace que las ediciones posteriores sean dolorosas. Subir la Speed a 1,3 para encajar en una diapositiva apretada hace que la voz suene apresurada, así que es mejor recortar palabras. Y saltarse la escucha con auriculares deja pasar pequeños errores de pronunciación hasta la exportación final. Dedica ese minuto extra por diapositiva y la fase de edición será fluida.

💡 Consejo para ElevenLabs V3: ElevenLabs V3 tiene los campos Previous Text y Next Text. Pega la diapositiva anterior y la siguiente, y el modelo ajusta la entonación en los límites para que la voz fluya de una diapositiva a otra.

Voz en off con IA para PowerPoint

PowerPoint es el lugar más rápido para ver el resultado. Una presentación narrada se puede compartir como video, reproducir en un quiosco o enviar a personas que nunca se unirán a una llamada en directo.

Presentador junto a una pantalla de proyector en una sala de reuniones luminosa

Añade el audio a cada diapositiva

  1. Selecciona la primera diapositiva en el panel de miniaturas.
  2. Elige Insertar, luego Audio, luego Audio en mi PC y selecciona slide-01.wav.
  3. En la pestaña Reproducción, fija Inicio en Automáticamente y marca Ocultar durante la presentación para que no aparezca el icono del altavoz.
  4. Haz clic en Recortar audio para leer la duración exacta del clip.
  5. En la pestaña Transiciones, marca Después en Avanzar diapositiva y escribe esa duración, más medio segundo de margen.
  6. Repite con todas las diapositivas.

Ahora el audio empieza solo, y la diapositiva avanza cuando termina la frase. No hace falta hacer clic durante la reproducción. Si una diapositiva tiene animaciones, configúralas en Inicio: Después de la anterior para que la secuencia de elementos avance al mismo ritmo que la voz en lugar de esperar un clic.

💡 Consejo: Para presentaciones que viajan por correo electrónico, exporta la narración desde Speech 2.8 HD como MP3 a 128 kbps en lugar de WAV. El archivo ocupa poco espacio y nadie notará la diferencia en los altavoces de un equipo portátil.

Exporta un video narrado

Ve a Archivo, luego Exportar, luego Crear un video. Elige Full HD (1080p), deja seleccionada la opción Usar tiempos y narraciones grabados y haz clic en Crear video. PowerPoint respeta los tiempos de avance que escribiste, así que el video coincide con el audio segundo a segundo.

Voz en off con IA en Premiere Pro

En una edición de video, la voz es tu ancla. El audio de IA nunca cambia de ritmo entre tomas, así que puedes fijar primero la narración y cortar las imágenes para que coincidan con ella.

Editor de video visto desde atrás frente a una configuración de doble monitor con una línea de tiempo multipista

Importa y sincroniza con la línea de tiempo

  1. Pulsa Ctrl+I (Cmd+I en Mac) e importa todos los archivos de voz en un contenedor llamado VO.
  2. Arrastra scene-01.wav a A1 al inicio de la secuencia y luego coloca los siguientes archivos uno detrás de otro.
  3. Usa la herramienta de cuchilla (C) y el borrado de desplazamiento (ripple delete) para cerrar cualquier hueco más largo de lo que quieres.
  4. Pulsa M en las palabras exactas donde debe cambiar una imagen y corta tu metraje en esos marcadores.

Premiere ajusta automáticamente los archivos de 44,1 kHz a la secuencia de 48 kHz, así que no necesitas remuestrear nada a mano.

Limpia el audio con Essential Sound

Abre Ventana, luego Essential Sound, selecciona los clips de voz y haz clic en Diálogo. En Sonoridad, pulsa Auto-Match. Pon la música en su propia pista, etiquétala como Música y activa Ducking frente a los clips de diálogo para que la banda sonora baje cada vez que habla la voz. Si alguna S suena aguda, añade el efecto DeEsser a la pista de voz.

PistaContenidoObjetivo
A1Voz en off con IAEtiquetada como Diálogo, Auto-Match
A2MúsicaEtiquetada como Música, con ducking bajo A1
A3Efectos de sonidoBajos en la mezcla, nunca más fuertes que la voz
Mezcla finalSecuencia completaAlrededor de menos 14 LUFS para video web

💡 Consejo: Si una línea suena mal, no la arregles con complementos. Edita el texto, regenera ese único archivo con los mismos ajustes y cámbialo en la línea de tiempo. Lleva menos tiempo que corregirlo a oído.

Voz en off con IA en DaVinci Resolve

Resolve premia el mismo enfoque. Fija la voz y construye todo lo demás a su alrededor. La versión gratuita de Resolve basta para todos los pasos siguientes.

Manos ajustando faders en una pequeña superficie de control para mezcla de audio

Construye la edición en la página Edit

  1. Pulsa Ctrl+I o arrastra tus archivos de voz al Media Pool.
  2. En la página Edit, suelta cada archivo en Audio 1 siguiendo el orden de las escenas.
  3. Pulsa B para la herramienta Blade y recorta el silencio al inicio y al final de cada clip, después cierra los huecos con un borrado de desplazamiento (ripple delete).
  4. Pulsa M para colocar marcadores en la línea de tiempo en las palabras donde debe cambiar la imagen.

Resolve remuestrea por sí mismo los archivos de 44,1 kHz a la línea de tiempo de 48 kHz.

Equilibra los niveles en Fairlight

Cambia a la página Fairlight. Haz clic con el botón derecho sobre los clips de voz y elige Normalize Audio Levels para que todas las escenas queden con la misma sonoridad. Revisa el resultado en el medidor de sonoridad y ajusta el bus Main 1 hasta que la línea de tiempo terminada quede cerca de menos 14 LUFS para entrega web. Para la música, puedes subir y bajar el volumen a mano con automatización o usar un compresor en la pista musical con la voz como sidechain.

Así se alinean las tres herramientas en las mismas tareas:

TareaPowerPointPremiere ProDaVinci Resolve
Importar audioInsertar, Audio, Audio en mi PCArchivo, ImportarArchivo, Importar, Media
Mejor formato de archivoMP3 a 128 kbpsWAVWAV
Método de sincronizaciónAvanzar diapositiva, DespuésHerramienta de cuchilla y borrado de desplazamientoHerramienta Blade y borrado de desplazamiento
Igualación de nivelesVolumen de reproducciónEssential Sound, Auto-MatchNormalize Audio Levels en Fairlight
ExportarCrear un videoExportar (Ctrl+M)Página Deliver

Subtítulos, doblaje y elementos visuales

La voz en off es solo una parte de la pieza terminada. El mismo guion alimenta los subtítulos, las traducciones y las imágenes en pantalla.

Mujer con auriculares escuchando en un espacio de coworking luminoso con un trípode en primer plano

Subtítulos y doblaje a partir de un solo guion

Para los subtítulos, activa los metadatos de subtítulos en Speech 2.8 HD para obtener marcas de tiempo por frase, o pasa el audio final por GPT-4o Transcribe para obtener una transcripción, y después incrusta los subtítulos en un clip exportado con Autocaption.

Para otros idiomas, tienes dos rutas limpias:

Para añadir una nueva pista de voz a un MP4 existente sin abrir un editor, Video Audio Merge reemplaza o mezcla la banda sonora.

Elementos visuales de diapositivas e imágenes de cobertura

Una gran narración sobre imágenes flojas sigue perdiendo al público. Genera imágenes fotográficas fijas para tus diapositivas y planos de cobertura con un modelo de texto a imagen: P Image es rápido para borradores, mientras que Seedream 4.5 y FLUX.2 Pro encajan en imágenes principales. Describe el objetivo, la luz y las texturas de las superficies, y fija la relación de aspecto en 16:9 para que la imagen llene una diapositiva o un fotograma de la línea de tiempo sin recortes.

Diseñador fijando fotografías impresas en una pared blanca como tablero visual de inspiración

Pruébalo en tu próximo proyecto

Elige la presentación o el video que llevas tiempo posponiendo grabar. Pega su primera diapositiva en Speech 2.8 HD en PicassoIA, pulsa ejecutar y arrastra el archivo a PowerPoint, Premiere Pro o DaVinci Resolve. Después genera la siguiente diapositiva con otra voz y compara. Al llegar al tercer archivo sabrás qué voz encaja con tu contenido y qué ajustes no vuelves a tocar nunca.

Todo este flujo de trabajo vive en un solo lugar: voces, transcripción, subtítulos, doblaje y generación de imágenes. Explora el catálogo completo en picassoia.com/en/all-models, prueba dos o tres voces con tu propio guion y deja que tu próxima presentación se narre sola.

Compartir este artículo

Elige tu idioma