Pagar por un generador de voz se vuelve un problema en cuanto un solo capítulo de audiolibro se come tus créditos del mes. Esa es la historia detrás de la mayoría de las búsquedas de una alternativa a ElevenLabs: las voces suenan genial, pero los límites, las condiciones de licencia y el precio por carácter hacen que la gente busque en otro sitio. La buena noticia es que el mercado ya ofrece opciones reales. Algunas se pueden probar gratis en el navegador, otras son de código abierto y se ejecutan en tu propio equipo, y unas pocas clonan una voz a partir de un clip de apenas diez segundos.
Este artículo ordena esas opciones según lo que realmente necesitas. Verás hasta dónde llegan los planes gratuitos, qué motores de código abierto merecen la pena instalar, cómo funciona la clonación de voz en la práctica y un recorrido paso a paso con Chatterbox en PicassoIA. La música y la transcripción van al final, porque casi todo proyecto de voz las necesita tarde o temprano.
Por qué la gente deja de lado ElevenLabs
ElevenLabs se ganó su reputación. Sus voces transmiten emoción, su salida multilingüe es sólida y su editor está muy pulido. Nadie serio lo discute. La fricción aparece después, cuando el proyecto ya está en marcha y el contador no deja de subir.

El problema de los créditos
El precio se basa en créditos, y los créditos se gastan rápido. El plan gratuito ha ofrecido históricamente unos 10 000 créditos al mes, lo que equivale a unos diez minutos de habla. Un artículo de 3000 palabras leído en voz alta dura unos 20 minutos a un ritmo normal, así que una narración más un par de repeticiones vacía la cuenta.
💡 Cálculo rápido: 150 palabras por minuto es una velocidad cómoda para narrar. Un guion de 3000 palabras son 20 minutos de audio antes de contar una sola repetición.
Los límites de los planes cambian a menudo, así que trata cualquier cifra que leas, incluida esta, como una foto del momento y consulta la página de precios actual antes de decidir.
Preocupaciones por licencias y privacidad
Hay otras tres quejas que aparecen una y otra vez:
- Derechos comerciales. Los planes gratuitos suelen exigir atribución o bloquean el uso comercial, así que un canal de YouTube monetizado acaba en un plan de pago de todas formas.
- Datos de voz. Subir una grabación de ti mismo, de un cliente o del director general de un cliente implica confiar en la política de retención de otro.
- Dependencia. Una voz clonada que vive dentro de la cuenta de un proveedor no se puede trasladar a otra herramienta.
Esos tres puntos débiles explican por qué las alternativas se dividen en dos bandos: herramientas alojadas con límites generosos y modelos de código abierto que tú controlas.
Opciones gratuitas que realmente funcionan
«Gratis» es una palabra resbaladiza en este mercado. Antes de invertir una tarde, decide qué tipo de gratis estás eligiendo.

Planes gratuitos en herramientas alojadas
Un plan gratuito alojado te da un inicio rápido sin configurar nada. Escribes, pulsas generar y descargas. En PicassoIA puedes ejecutar varios modelos de voz directamente desde el navegador, entre ellos Chatterbox Turbo, Speech 2.8 Turbo y Gemini 3.1 Flash TTS, que ofrece 30 voces en más de 70 idiomas. Para pruebas de narración, anuncios cortos y clips para redes, es más que suficiente.
Los planes gratuitos alojados sirven mejor para estos trabajos:
- Pruebas de guion. Escucha cómo suena un párrafo antes de comprometerte con una voz.
- Anuncios cortos y reels. Treinta segundos de audio rara vez alcanzan un límite mensual.
- Revisiones de idioma. Pasa la misma frase por tres idiomas y compara.
Un flujo de trabajo sensato combina ambos mundos. Haz el borrador y prueba voces en una herramienta alojada, donde no hay nada que instalar, y luego pasa los trabajos largos, como capítulos de audiolibro o un curso completo, a un modelo de código abierto cuando sepas qué voz y qué ajustes te gustan. Gastas créditos en decisiones y nada en volumen.
Lo que «gratis» suele costar
Cada ruta gratuita cambia algo por otra cosa. Esta tabla muestra lo que cedes:
| Ruta gratuita | Lo que cedes | Ideal para |
|---|
| Plan gratuito alojado | Límites mensuales, colas más lentas en horas punta | Anuncios cortos, pruebas rápidas |
| Código abierto en tu equipo | Tiempo de configuración y una GPU capaz | Narración larga, audio privado |
| Pesos abiertos con licencia no comercial | El derecho a monetizar la salida | Proyectos personales, investigación |
| Voces del sistema integradas | Sonido natural | Accesibilidad, borradores |
Voces de código abierto que puedes ejecutar
El código abierto cambia el modelo de costos. Pagas con tiempo de configuración en lugar de créditos y, una vez que la instalación funciona, el minuto número mil de audio cuesta lo mismo en electricidad que el primero.

Chatterbox y Qwen3 TTS
Dos modelos merecen una primera mirada porque ambos clonan voces y se pueden probar en PicassoIA sin instalar nada.
Chatterbox, de Resemble AI, se publicó con licencia MIT, y sus creadores lo describen como el primer modelo TTS de código abierto con control de exageración emocional. Chatterbox clona una voz a partir de unos pocos segundos de audio de referencia, ajusta la expresividad con un solo control deslizante y te permite fijar una semilla para obtener tomas repetibles. Cada salida lleva una marca de agua inaudible, así que el audio generado se puede rastrear. Existen dos variantes para otras necesidades: Chatterbox Turbo para velocidad y Chatterbox Pro para trabajos de locución.
Qwen3 TTS, de Qwen, funciona en tres modos. Qwen3 TTS ofrece nueve locutores predefinidos, clonación de voz a partir de un clip de referencia más su transcripción, y diseño de voz, donde describes una voz con lenguaje natural, por ejemplo un narrador masculino tranquilo con un ligero acento francés, y el modelo la crea. Habla 10 idiomas, entre ellos inglés, español, francés, alemán, japonés y coreano, y un campo de instrucciones de estilo te permite añadir indicaciones como «habla despacio» o «tono entusiasta».
Motores locales que vale la pena probar
Si quieres tenerlo todo en tu propio hardware, estos proyectos tienen comunidades activas:
- Kokoro: un modelo pequeño de unos 82 millones de parámetros con licencia Apache. Funciona rápido en un equipo portátil modesto y suena limpio para narración, pero no clona voces.
- Piper: diseñado para uso sin conexión y lo bastante ligero para una Raspberry Pi. Las voces son funcionales más que expresivas, lo que encaja con proyectos de domótica y lectores de pantalla.
- XTTS-v2 de Coqui: clona una voz a partir de unos seis segundos de audio en 17 idiomas. Su licencia restringe el uso comercial, y la empresa que lo respaldaba cerró a principios de 2024.
- Bark: con licencia MIT y capaz de producir risas y suspiros, aunque los resultados varían mucho de una ejecución a otra.
💡 Lee el archivo de licencia. «Abierto» a veces significa código abierto con pesos del modelo restringidos. Revisa el repositorio antes de publicar audio clonado en un canal monetizado.
Clonación de voz sin muro de pago
La clonación de voz es la función por la que más se paga. ElevenLabs la ha colocado normalmente en planes de pago, y por eso esta sección importa a cualquiera que vigile su presupuesto.

Cuánto audio necesitas
Menos de lo que la mayoría espera, siempre que esté limpio:
- Unos pocos segundos: suficiente para que Chatterbox produzca un clon reconocible.
- De 10 segundos a 5 minutos: el rango que acepta MiniMax Voice Cloning, en archivos MP3, M4A o WAV de menos de 20 MB.
- Clip corto más transcripción: lo que Qwen3 TTS necesita en modo clonación. Escribir lo que dice el locutor mejora la coincidencia.
MiniMax Voice Cloning funciona de forma distinta a las demás. Subes una muestra una vez, recibes un perfil de voz reutilizable y luego aplicas esa voz en modelos de habla como Speech 2.6 HD, Speech 2.6 Turbo, Speech 02 HD y Speech 02 Turbo. La reducción de ruido opcional y la normalización de volumen salvan las grabaciones hechas fuera de una habitación silenciosa.
Un buen clip de referencia cumple cinco reglas sencillas:
- Graba en una habitación silenciosa con muebles que absorban el sonido.
- Mantén el micrófono a una distancia fija y constante.
- Habla a tu ritmo natural, sin música de fondo.
- Incluye un único hablante.
- Exporta un WAV limpio o un MP3 de alta tasa de bits.
Qwen3 TTS maneja la clonación de forma algo distinta. Cambia el modo a clonación de voz, sube tu audio de referencia, pega lo que dice el locutor en Reference Text y luego escribe la nueva línea que quieres que se diga. Omitir la transcripción también funciona, pero la coincidencia es menos precisa, sobre todo en nombres y palabras poco comunes. Si no tienes ninguna muestra, el modo de diseño de voz te permite describir un locutor en su lugar, y las instrucciones de estilo como lento y cálido ajustan la interpretación.
Consentimiento y marcas de agua
Clona solo voces que sean tuyas o para las que tengas permiso por escrito. Guarda ese permiso y etiqueta el audio sintético siempre que una plataforma lo pida. Chatterbox ayuda en esto, porque su marca de agua integrada mantiene los clips generados rastreables sin cambiar cómo suenan.
Cómo usar Chatterbox en PicassoIA
Chatterbox es lo más parecido a una respuesta gratuita y de código abierto para la clonación de voz expresiva, así que aquí tienes un recorrido completo en su página del modelo.

Prepara el clip de referencia
Elige una grabación de 10 a 30 segundos de la voz que quieras, recorta el silencio del principio y elimina la música o el ruido de fondo. Súbelo en el campo Audio Prompt. Si dejas el campo vacío, Chatterbox usa su voz predeterminada, lo cual es útil para una primera prueba de tu guion.
Ajusta los controles deslizantes
Pega tu guion en Prompt y luego ajusta los controles. Los valores predeterminados son un punto de partida seguro:
| Ajuste | Predeterminado | Qué hace | Consejo |
|---|
| Exaggeration | 0.5 | Define lo expresiva que es la interpretación | Prueba 0.3 para narración tranquila y 0.6 a 0.7 para lecturas enérgicas. Los valores extremos pueden sonar inestables. |
| CFG Weight | 0.5 | Controla el ritmo | Bájalo hacia 0.3 si el locutor de referencia habla rápido. |
| Temperature | 0.8 | Define la variación entre tomas | Más bajo para una salida predecible, más alto para más carácter. |
| Seed | 0 | Fija la toma | Cero es aleatorio. Cuando una toma suene bien, anota la semilla y reutilízala. |
Cambia un ajuste a la vez, o nunca sabrás qué control deslizante resolvió el problema.
Revisa el resultado
Ejecuta la generación, escucha con auriculares y compara la salida con el guion. Los guiones largos funcionan mejor si los divides en párrafos de unas pocas frases y los generas uno por uno. Para detectar rápido palabras omitidas o mal pronunciadas, pasa el audio final por GPT-4o Transcribe y compara el texto con tu original.
💡 Truco para repetir tomas: conserva la semilla, cambia solo el valor de exaggeration en 0.1 y genera de nuevo. Obtendrás la misma voz con una interpretación ligeramente distinta.
Comparación lado a lado
Así se comparan las rutas principales, según lo que cada herramienta documenta sobre sí misma:
| Opción | Tipo | Clonación de voz | Modelo de costos | Ideal para |
|---|
| ElevenLabs | Alojado | Planes de pago | Créditos mensuales | Locución multilingüe pulida |
| Chatterbox | Código abierto, MIT | Sí, desde unos pocos segundos | Gratis si se ejecuta en local | Narración expresiva |
| Qwen3 TTS | Pesos abiertos | Sí, más diseño de voz | Gratis si se ejecuta en local | Proyectos multilingües |
| MiniMax Voice Cloning | Alojado | Sí, de 10 segundos a 5 minutos | Servicio alojado | Perfiles de voz reutilizables |
| Kokoro | Código abierto | No | Gratis si se ejecuta en local | Narración rápida sin conexión |
| Piper | Código abierto | No | Gratis si se ejecuta en local | Dispositivos sin conexión |
| XTTS-v2 | Pesos abiertos, no comercial | Sí | Gratis para uso personal | Proyectos personales |
El veredicto honesto: ElevenLabs sigue marcando el listón en pulido y cobertura de idiomas, y nadie debería fingir lo contrario. Lo que ha cambiado es la distancia. Para intros de pódcast, videos de productos, explicaciones y voces de personajes, las opciones anteriores suenan lo bastante bien como para que el factor decisivo pase a ser el costo, la licencia y el control, más que la calidad pura. Prueba tu propio guion con dos o tres de ellas antes de pagar por algo.

Elige según el caso de uso
- Intros y cierres de pódcast: Chatterbox con una semilla fija mantiene cada episodio coherente.
- Videos de productos y anuncios: Speech 2.8 HD apunta a locuciones de calidad de estudio.
- Contenido multilingüe: Qwen3 TTS y Gemini 3.1 Flash TTS manejan muchos idiomas.
- Diálogos de dos voces: Play Dialog está pensado para audio conversacional.
- Aplicaciones de baja latencia: Realtime TTS 1.5 Max apunta a respuestas por debajo de 200 ms.
- Seguir con las voces de ElevenLabs: ElevenLabs v3 y Flash v2.5 también están disponibles en PicassoIA, así que puedes compararlas con las alternativas en un solo lugar.

Más allá del habla: música y transcripciones
ElevenLabs también vende generación de música y transcripción, así que una alternativa justa tiene que cubrir esos trabajos también. Ambos están disponibles en PicassoIA.
Música sin dolores de cabeza por licencias
Una locución suele necesitar una base musical debajo. Estos modelos la generan a partir de un prompt de texto:
- Music 2.6 de MiniMax escribe canciones completas, con voces incluidas.
- Lyria 3 Pro de Google crea canciones de duración completa.
- Stable Audio 2.5 compone música a partir de una descripción de texto, lo que encaja con fondos instrumentales.
- ElevenLabs Music está ahí si quieres quedarte en ese ecosistema.

Transcribe el audio a texto
La transcripción cierra el círculo. GPT-4o Transcribe acepta archivos MP3, MP4, WAV, M4A, OGG y WebM, admite un código de idioma ISO para mayor precisión y acepta un breve prompt de estilo. GPT-4o Mini Transcribe es la opción más ligera, y Gemini 3 Pro también genera transcripciones precisas.

Los usos prácticos incluyen:
- Comprobar que una voz clonada leyó tu guion palabra por palabra.
- Añadir subtítulos a un video narrado.
- Convertir episodios de pódcast en artículos escritos.
- Registrar entrevistas que grabaste con el teléfono.
Crea tu primera locución hoy
No necesitas una suscripción mensual para conseguir una voz sintética convincente. Elige un guion corto, clona una voz con Chatterbox o MiniMax Voice Cloning, añade debajo una pista de Stable Audio 2.5 y comprueba el resultado con GPT-4o Transcribe. Ese flujo de trabajo lleva minutos, no una tarde.
PicassoIA reúne modelos de habla, música y transcripción en un solo lugar, así que puedes compararlos con tu propio guion en lugar de fiarte de una ficha técnica. Abre la lista completa de modelos, graba una muestra de diez segundos y escucha lo que hace tu voz con un párrafo nuevo. Experimenta con los controles deslizantes, prueba una segunda voz y quédate con la toma que más se parezca a ti.