Voz en off con IA gratis: generadores para video, TikTok y CapCut que suenan humanos

Herramientas gratuitas de voz en off con IA para video, TikTok y CapCut, ordenadas por lo naturales que suenan. Compara las voces integradas con los generadores de navegador, ajusta la emoción, la velocidad y el tono, y luego une el audio, añade subtítulos y publica un clip que suene como una persona real.

Voz en off con IA gratis: generadores para video, TikTok y CapCut que suenan humanos
Cristian Da Conceicao
Fundador de Picasso IA

Tienes un clip de 30 segundos, un guion en la app de notas y ninguna gana de grabar tu voz a las 11 de la noche mientras el perro del vecino ladra al otro lado de la pared. Para eso se crearon las herramientas de voz en off con IA gratis. Pegas el texto, eliges una voz, pulsas generar y en segundos tienes una pista de narración lista para ponerla bajo un TikTok, un proyecto de CapCut o un Short de YouTube.

El truco es que lo "gratis" adopta formas muy distintas. Algunos generadores ofrecen una lectura plana y robótica. Otros entregan un MP3 limpio sin ninguna condición. Este artículo ordena las opciones reales para video, TikTok y CapCut, muestra cuáles suenan humanas y recorre un flujo de trabajo completo, desde el guion hasta el clip publicado.

Un joven con una sudadera gris escribiendo un guion corto de voz en off en un equipo portátil sobre una mesa de cocina

💡 Respuesta rápida: TikTok y CapCut incluyen voces integradas sin costo. Para una narración más natural, con control sobre la emoción, la velocidad y el tono, un generador de navegador como Speech 2.8 HD exporta un MP3 o WAV limpio que puedes importar en cualquiera de las dos apps.

Por qué la voz en off gratis con IA funciona ahora

Hace dos años, una voz gratuita era un lector metálico que acentuaba la sílaba equivocada y leía cada frase a la misma velocidad. Los modelos modernos de texto a voz predicen el ritmo, la respiración y el énfasis a partir de la propia frase. El resultado aguanta en el altavoz de un teléfono, que es donde la mayoría de los espectadores de formato corto lo escuchan de verdad.

Qué obtienes sin pagar nada

Una buena configuración gratuita te da más que una voz:

  • Narración natural en inglés y, a menudo, en decenas de otros idiomas
  • Control de velocidad y tono, para que un guion de 45 segundos quepa en un hueco de 30
  • Ajustes de emoción que cambian la interpretación sin tener que volver a grabar
  • Repeticiones instantáneas, porque regenerar una línea cuesta segundos y no una reserva de estudio
  • Sin micrófono, sin tratamiento acústico y sin zumbido de fondo que corregir en la edición

Dónde marcan el límite los planes gratuitos

Gratis rara vez significa ilimitado. Antes de construir un canal alrededor de una herramienta, revisa estos límites:

  • Topes mensuales de caracteres o minutos
  • Voces bloqueadas tras un plan de pago
  • Licencias solo para uso personal que descartan canales monetizados o trabajos para clientes
  • Colas en las horas de mayor actividad
  • Formatos de exportación limitados a MP3 de baja tasa de bits

Ninguno de estos límites es un obstáculo para un canal de afición. Se convierten en un problema el día en que un clip empieza a generar dinero, así que decide pronto de qué lado de esa línea estás.

💡 Lee primero la licencia. Una voz que sirve para un clip privado puede no estar permitida para anuncios, publicaciones patrocinadas o el video de producto de un cliente. Cinco minutos revisando la página de términos te ahorran una retirada del contenido más adelante.

Opciones gratuitas para TikTok y CapCut

No necesitas una app aparte para una voz en off básica. Tampoco conviene esperar que las voces integradas sostengan un proyecto serio.

El texto a voz integrado de TikTok

TikTok incluye un efecto de texto a voz dentro de su propio editor. Añades texto en pantalla, lo tocas y eliges la opción de texto a voz para convertir las palabras en una voz hablada. Es la vía más rápida para bromas, clips de reacción y subtítulos cortos en los que un tono ligeramente sintético forma parte del humor.

La contrapartida es la variedad. La lista de voces es corta, los espectadores las reconocen al instante y apenas tienes control sobre la emoción o el ritmo.

Manos sujetando un teléfono en vertical mientras editan un video corto con una barra de audio

Texto a voz en CapCut

CapCut ofrece una herramienta de texto a voz en escritorio y en dispositivos móviles. Añades una capa de texto, abres el panel de voz, eliges una voz y el audio aparece en la línea de tiempo como un clip propio. Eso importa: puedes recortarlo, cambiar su volumen y alinearlo con tus cortes como cualquier otra pista.

Algunas voces y efectos están detrás de un plan de pago, así que prueba la voz exacta que vas a usar antes de comprometer todo un proyecto con ella.

Equipo portátil mostrando una línea de tiempo de edición de video con una onda de audio larga junto a una taza de café

Generadores de navegador para mejores voces

Cuando las voces integradas resultan demasiado familiares, genera el audio en el navegador, descarga el archivo e impórtalo en CapCut o TikTok como un sonido. Mantienes el flujo de edición que ya conoces y cambias solo la voz.

OpciónCalidad de vozControlMejor para
Voz integrada de TikTokBásica, fácil de reconocerMuy bajoBromas, subtítulos cortos
Voz integrada de CapCutCorrecta, con algo de variedadBajo a medioEdiciones que ya haces en la app
Speech 2.8 HDAlta, naturalEmoción, velocidad, tono, pausasNarración, explicaciones, anuncios
ChatterboxAlta, expresivaClonación de voz con control de emociónPersonajes, presentadores recurrentes

Una regla sencilla ayuda aquí: usa la voz integrada cuando la voz forme parte del chiste, y una voz generada cuando el espectador necesite creer lo que se dice. Una demo de producto, un tutorial o un resumen de estilo informativo entran en el segundo grupo.

Los mejores modelos de voz con IA gratuitos, comparados

PicassoIA reúne 24 modelos de texto a voz, y no todos sirven para el mismo trabajo. Esta lista corta nombra los que merece la pena probar primero.

ModeloFortalezaIdeal para
Speech 2.8 HDEmoción, tono, velocidad, pausas con tiempoNarración, explicaciones
Speech 2.8 TurboRespuesta rápidaBorradores, repeticiones rápidas
ElevenLabs v3Interpretación naturalNarración de historias, YouTube
ElevenLabs Flash v2.5VelocidadProbar muchas variantes de guion
Gemini 3.1 Flash TTS30 voces, más de 70 idiomasCanales multilingües
Qwen3 TTSClonar una voz o diseñar la tuyaVoces de marca
DubbingTraduce videos a más de 90 idiomasLocalizar clips terminados

Opciones para narración

Empieza con Speech 2.8 HD cuando necesites una voz que hable sobre imágenes durante 30 segundos o más. Es el modelo con más ajustes: diez estilos de interpretación, tono en semitonos, velocidad de la mitad al doble y marcadores de pausa escritos directamente en el guion.

ElevenLabs v3 es la segunda que conviene probar, sobre todo para videos narrativos en los que la interpretación debería parecer relajada. Si solo necesitas una lectura rápida para comprobar el tiempo, Speech 2.8 Turbo y ElevenLabs Flash v2.5 devuelven el audio más rápido, lo que ayuda cuando estás probando diez versiones de un mismo gancho.

Clonación y voces personalizadas

Un personaje recurrente o una voz de canal de marca requiere clonación. Chatterbox clona voces con control de emoción, MiniMax Voice Cloning crea voces personalizadas a partir de una muestra, y Qwen3 TTS puede clonar una voz o diseñar una nueva.

💡 Clona solo una voz que tengas permiso para usar. Tu propia voz, un actor de doblaje que haya dado su consentimiento o una voz que hayas diseñado desde cero son puntos de partida seguros. La voz de un desconocido, no.

Una mujer grabando su propia voz en un armario convertido en cabina vocal

Grabarte en un armario lleno de abrigos sigue funcionando, y muchos creadores lo prefieren. Pero cuando necesitas veinte clips en una semana, una voz clonada o diseñada ahorra horas y mantiene todos los videos sonando igual.

Cómo usar Speech 2.8 HD en PicassoIA

Speech 2.8 HD se presenta como una herramienta online gratuita, admite hasta 10 000 caracteres por generación y maneja más de 40 idiomas. Así es todo el proceso, un ajuste a la vez.

Escribe el guion para la voz

  1. Abre la página del modelo y busca el campo Text.
  2. Escribe frases cortas, de unas 12 a 15 palabras cada una. Léelas en voz alta antes de pegarlas.
  3. Añade una pausa con <#0.5#>, que inserta medio segundo de silencio. Usa <#1#> para un segundo completo antes de un remate.
  4. Escribe los nombres que la voz podría pronunciar mal tal como quieres que se digan.

Una frase de ejemplo que funciona bien:

Tres voces gratuitas. Un minuto cada una. <#0.5#> ¿Cuál suena como una persona real?

Léelo con un cronómetro. Un ritmo cómodo ronda las 150 palabras por minuto a velocidad 1.0, así que un clip de 30 segundos admite unas 75 palabras.

Ajusta la voz, la emoción y la velocidad

Elige una voz en voice_id. La predeterminada es Wise_Woman, una lectora tranquila y uniforme, y una base segura para tutoriales. Después ajusta lo demás:

AjusteRangoPunto de partida para video
speed0.5 a 2.01.0 para explicaciones, 1.1 a 1.2 para TikTok
pitch-12 a +12 semitonos0 para neutro, +2 para un tono más animado
emotionauto, happy, sad, angry, fearful, disgusted, surprised, calm, fluent, neutralcalm para tutoriales, happy para anuncios
language_boostAutomático o un idioma específicoConfigúralo siempre que el guion mezcle idiomas
english_normalizationon u offOn cuando el guion tiene números y fechas
audio_formatmp3, wav, flac, pcmmp3 para subir, wav para editar
bitrate32k a 256k128k para la mayoría de clips, 256k cuando la calidad importa

Cambia un ajuste por toma. Si modificas a la vez la velocidad, el tono y la emoción, no sabrás cuál de los cambios resolvió el problema.

Exporta y revisa la toma

Genera el audio y escúchalo dos veces: una con auriculares, para detectar chasquidos y acentos raros, y otra por el altavoz del teléfono, porque eso es lo que oirá tu audiencia. Si una palabra suena mal, reescribe la frase en lugar de pelear con la voz. Un cambio de redacción suele arreglarlo más rápido que cualquier ajuste.

Un hombre con auriculares circumaurales revisando una toma de audio en un pequeño estudio casero

Activa subtitle_enable si quieres marcas de tiempo por frase junto al audio. Así el subtitulado irá más rápido después.

Pon la voz en tu video

Un archivo de voz por sí solo no es un video. Tres pasos más lo convierten en algo que puedes publicar.

Une el audio con Video Audio Merge

Video Audio Merge une un archivo de video y un archivo de audio en una sola exportación. Sube ambos y revisa estos ajustes:

  • Replace Audio: actívalo cuando el clip esté en silencio o el sonido original sea ruido; desactívalo si quieres mezclar la narración sobre la pista existente
  • Audio Volume: un multiplicador donde 1.0 es el nivel original; pon un archivo de música a 0.5 antes de unirlo para que la voz se mantenga por encima
  • Duration Mode: elige video para que la exportación termine cuando termine la imagen
  • Output Format: MP4 con H264 se reproduce casi en cualquier parte

Si ya editas en CapCut, sáltate este paso y arrastra el MP3 directamente a la línea de tiempo.

Subtítulos que coinciden con la voz

Muchos espectadores miran sin sonido, así que los subtítulos no son opcionales. Autocaption lee el audio y graba subtítulos con estilo sobre la imagen.

Un pasajero en un tren viendo un video vertical sin sonido

La página del modelo sugiere MaxChars 20 y font size 7 para videos estándar, y MaxChars 10 y font size 4 para reels verticales. Mantén la posición predeterminada, añade un resaltado amarillo de palabras y descarga la transcripción en JSON. Si se escuchó mal un nombre de marca, corrígelo en la transcripción y vuelve a generar el video con el archivo corregido. El audio sintético limpio suele transcribirse bien, así que las correcciones suelen ser pocas.

Combina la voz con clips de video con IA

¿No tienes imágenes? Genéralas. Seedance 2.5 Lite aparece como un generador gratuito e ilimitado para clips de hasta 10 segundos, y Veo 3.1 Lite crea videos con audio nativo. Después termina la edición con tres herramientas pequeñas:

  • Trim Video recorta un clip a la duración exacta de tu narración
  • Video Merge une varios clips en una sola línea de tiempo
  • Reframe Video cambia la relación de aspecto, que es lo que convierte un clip 16:9 en un TikTok 9:16

Voces en off para distintos creadores

El mismo flujo de trabajo se adapta a trabajos distintos. Estas son las configuraciones que funcionan en la práctica.

Tiendas y creadores de cursos

Una tienda pequeña necesita diez clips cortos de producto, no un largometraje. Escribe tres frases por producto, usa la emoción happy o calm y mantén el mismo voice_id en todos los clips para que la marca suene coherente.

Una dueña de tienda grabando velas artesanales sobre una mesa de empaquetado

Los profesores y creadores de cursos tienen el problema contrario: guiones largos y correcciones frecuentes. Genera la narración una diapositiva o un paso de lección cada vez, fija la velocidad en 0.9 o 1.0 y añade una pausa <#1#> después de cada término nuevo. Cuando cambia una definición, regeneras un solo clip en lugar de toda la lección.

Un profesor grabando una explicación de clase con una tableta en un escritorio de aula

Viajeros y canales multilingües

Un canal de viajes puede publicar una misma edición en varios idiomas. Gemini 3.1 Flash TTS ofrece 30 voces en más de 70 idiomas, y Dubbing traduce un video terminado a más de 90 idiomas. En Speech 2.8 HD, configura language_boost con el idioma de destino para que la pronunciación se mantenga natural.

Un vlogger de viajes trabajando en un equipo portátil en una terraza soleada de azotea

Mantén las frases cortas y evita los modismos, que casi nunca sobreviven a la traducción. Para cualquier cosa importante, pide a un hablante nativo que la escuche una vez antes de publicar.

Cinco errores que hacen que la IA suene falsa

  1. Escribir para el ojo. Las frases largas y llenas de comas se leen bien en una página, pero suenan torpes en voz alta. Corta toda frase que necesite una pausa para respirar a mitad.
  2. Dejar que los números descarrilen la voz. Las fechas, los precios y las abreviaturas son los culpables habituales. Activa la normalización en inglés o escríbelos como los dirías en voz alta.
  3. Saltarse las pausas. Una voz que nunca se detiene suena a máquina. Inserta marcadores <#0.5#> después de los ganchos y antes de las cifras grandes.
  4. Enterrar la voz bajo la música. Mantén la pista musical a la mitad de volumen, o menos, para que cada palabra se entienda en el altavoz de un teléfono.
  5. Usar la voz predeterminada para todo. Los espectadores notan cuando diez canales comparten una misma voz. Prueba tres voces con el mismo párrafo y elige la que encaje con tu tema.

Corrige estos cinco y una voz gratuita deja de sonar gratuita.

Prueba tu propia voz en off hoy

Elige un guion que ya tengas: una línea de producto de 30 segundos, la introducción de una lección o un resumen de viaje. Pégalo en Speech 2.8 HD, genera tres tomas con emociones distintas y quédate con la que suene a una persona hablando. Luego añade un clip, une el audio, subtitúlalo y publica.

Entra en Picasso IA para experimentar con modelos de voz, imágenes y video en un solo lugar, y comprueba lo rápido que un guion en bruto se convierte en un video terminado. Tu primera voz en off gratuita está a un paso: basta con pegar el guion.

Compartir este artículo

Elige tu idioma