Cómo usar ElevenLabs para generar voces gratis sin gastar ni un centavo
Una guía completa de las herramientas gratuitas de generación de voz de ElevenLabs: configuración de la cuenta, límites mensuales de caracteres, clonación de voz instantánea, integración con la API y las mejores alternativas gratuitas cuando 10.000 caracteres al mes no son suficientes.
La distancia entre la síntesis de voz robótica y las voces que de verdad engañan a la gente se cerró hace un par de años. ElevenLabs hizo mucho más que cerrarla: amplió el camino del otro lado. El problema es que la mayoría de la gente llega al tope del plan gratuito antes de descubrir lo que esta tecnología puede hacer de verdad. Este artículo explica paso a paso cómo usar ElevenLabs para generar voces gratis, qué significan en la práctica los límites y adónde ir cuando 10.000 caracteres al mes no son suficientes.
Qué incluye realmente el plan gratuito de ElevenLabs
ElevenLabs ofrece un nivel gratuito que es de verdad útil, no solo una demo. Esto es lo que obtienes sin introducir una tarjeta de crédito:
La cuota de caracteres
El plan gratuito incluye 10.000 caracteres al mes. Suena a mucho. En términos reales, 10.000 caracteres equivalen aproximadamente a:
De 1.500 a 1.700 palabras de contenido narrado
Un episodio de podcast de 7 a 10 minutos
Unas 12 a 15 locuciones cortas para redes sociales (de 60 a 80 palabras cada una)
Cuando agotas esos caracteres, la generación se detiene hasta el reinicio mensual. El contador se reinicia el mismo día del calendario en que creaste tu cuenta, no el día 1 del mes.
Opciones de voz sin costo
El plan gratuito te da acceso a:
Más de 30 voces predefinidas de distintas edades, géneros y acentos
Clonación de voz instantánea: hasta 3 voces personalizadas
10 idiomas para la generación estándar
Audio de calidad estándar (MP3 a 128 kbps)
Lo que el nivel gratuito NO incluye: clonación de voz profesional (modelo de alta fidelidad), derechos de licencia comercial, Projects (la herramienta para audiolibros de formato largo), Dubbing y formatos de audio de mayor calidad como PCM o FLAC.
Lo que no puedes hacer gratis
Función
Gratis
Starter (5 $/mes)
Creator (22 $/mes)
Caracteres al mes
10.000
30.000
100.000
Licencia comercial
No
Sí
Sí
Clonación de voz profesional
No
No
Sí
Calidad de audio
128 kbps
192 kbps
192 kbps
Herramienta Projects
No
No
Sí
La falta de licencia comercial es la limitación más importante. Todo lo que generes con el plan gratuito técnicamente no puede usarse en productos de pago, trabajos para clientes ni contenido monetizado.
Cómo configurar tu cuenta gratuita de ElevenLabs
La configuración lleva unos dos minutos.
Creación de la cuenta paso a paso
Ve a elevenlabs.io y haz clic en Sign Up
Introduce tu correo electrónico o usa OAuth con Google o GitHub
Confirma tu correo a través del enlace de verificación
Inicia sesión y llegarás directamente a la página de Speech Synthesis
En este paso no se pide tarjeta de crédito. La plataforma no solicita datos de pago hasta que decidas mejorar el plan.
Elegir tu primera voz
La biblioteca de voces del panel izquierdo se ordena por:
Género: Masculino, Femenino, No binario
Edad: Joven, De mediana edad, Mayor
Acento: Estadounidense, Británico, Australiano, Indio y más
💡 Filtra por "Conversational" para contenido en redes sociales y por "Narration" para guiones de formato largo. La categoría "News" suele sonar la más neutral y con mayor autoridad para contenido informativo.
Generar tu primera voz gratis
La interfaz de texto a voz
La interfaz principal es sencilla. Pega tu guion en el área de texto grande, selecciona una voz en la barra lateral y pulsa Generate. El verdadero matiz está en el panel de ajustes debajo del cuadro de texto:
Stability: controla lo constante que suena la voz de una frase a otra. Un valor bajo significa más expresividad y uno alto, más monotonía. Un valor de 0,5 a 0,65 es un buen punto de partida.
Similarity Enhancement: lo fiel que es la salida a la muestra de voz original. Mantenlo por encima de 0,75 para obtener mejores resultados.
Style Exaggeration: amplifica el estilo natural de la voz. Útil para narraciones dramáticas, arriesgado para contenido empresarial.
Ajustar los ajustes de voz
La mayoría de los principiantes ignora estos controles y luego se pregunta por qué la voz suena plana. Stability es el que más influye. Si tu voz suena robótica y uniforme, bájala hacia 0,4. Si suena errática e impredecible, súbela hacia 0,8.
💡 Añade pausas naturales a tu guion con puntos suspensivos ... o con un punto seguido de un espacio. En los planes de pago funciona la sintaxis SSML, como <break time="1.0s" />, pero estos sencillos trucos de puntuación también son eficaces en el plan gratuito.
Descargar tu archivo de audio
Después de generar, aparece un reproductor de audio verde debajo del cuadro de texto. Haz clic en el icono Download (una flecha hacia abajo) para guardar el archivo en MP3. El archivo se nombra con una marca de tiempo. No hay descarga masiva, así que si generaste 10 clips, los descargas uno a uno.
Clonación de voz gratuita en ElevenLabs
La clonación de voz es lo que le da a ElevenLabs su reputación. Incluso el plan gratuito te da la clonación de voz instantánea, que impresiona más de lo que la mayoría de la gente espera.
Lo básico de la clonación de voz instantánea
La clonación de voz instantánea (IVC) crea un modelo de voz a partir de una muestra de audio que subes. No es tan precisa como el modelo de clonación de voz profesional (que requiere más de 30 minutos de audio limpio y es una función de pago), pero para la mayoría de los casos es más que suficiente.
Ve a Voices > Add Voice > Instant Voice Clone y luego sube:
Un archivo WAV o MP3
Entre 30 segundos y 5 minutos de audio limpio
Un solo hablante con un mínimo de ruido de fondo
Un ritmo de lectura natural funciona mejor que el habla conversacional
Lo que necesitas
La calidad de tu clon depende por completo de la calidad de tu audio de origen. Una grabación hecha con un teléfono en una habitación silenciosa vence a una grabación profesional en un espacio con eco. La música de fondo es lo que más arruina la precisión del clon.
💡 Graba en un armario rodeado de ropa colgada. La tela absorbe los reflejos acústicos mejor que la mayoría de los paneles de espuma y no cuesta nada.
Límites del plan gratuito
En el plan gratuito puedes crear hasta 3 voces clonadas. Para crear una 4.ª, tienes que eliminar una de las tres existentes. Los clones se guardan solo en tu cuenta y no se pueden compartir públicamente. El audio generado con una voz clonada consume tu cuota mensual de 10.000 caracteres igual que las voces predefinidas.
Usar la API de ElevenLabs gratis
El plan gratuito incluye acceso a la API. Esto sorprende a muchos desarrolladores que dan por hecho que las APIs siempre están detrás de un muro de pago.
Límites de la API gratuita
Tu clave de API gratuita comparte la misma cuota de 10.000 caracteres mensuales que la interfaz web. No hay una asignación separada para la API. Cada carácter generado a través de la API reduce lo que puedes generar en el navegador, y viceversa.
El endpoint de la API para texto a voz es:
POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}
La autenticación usa la cabecera xi-api-key con tu clave, que encuentras en la página Profile Settings.
Prototipos: prueba la integración de voz en tu app antes de comprometerte con un plan de pago
Automatización de bajo volumen: un script que genera una locución diaria para una herramienta interna
Proyectos personales: clips de introducción de podcast, sonidos de notificación, apps de asistente personal
No construyas un producto de cara al cliente en producción sobre la API gratuita. El límite de 10.000 caracteres es un corte firme, sin período de gracia.
Cuando 10.000 caracteres no son suficientes
La mayoría de la gente alcanza el límite gratuito antes de lo que espera. Aquí tienes cómo calcular tus necesidades mensuales reales y tres formas de estirar tu cuota.
Calcular tus necesidades mensuales
Cuenta los caracteres de tus guiones, no las palabras. Una palabra media en inglés tiene unos 5 caracteres, contando el espacio que la sigue.
Tipo de contenido
Longitud media
Caracteres usados
Clip de redes sociales de 60 segundos
~130 palabras
~780 caracteres
Narración de YouTube de 5 minutos
~700 palabras
~4.200 caracteres
Episodio de podcast de 10 minutos
~1.400 palabras
~8.400 caracteres
Capítulo completo de audiolibro
~3.500 palabras
~21.000 caracteres
Un solo episodio de podcast de 10 minutos consume el 84 % de tu cuota mensual gratuita. Con dos episodios, te quedarás sin cuota antes de que termine la segunda semana del mes.
Tres formas de estirar el plan gratuito
1. Escribe guiones más ajustados. Elimina las palabras de relleno antes de generar. Cada cláusula innecesaria gasta caracteres. Edita primero, genera después.
2. Crea varias cuentas gratuitas. Cada nueva dirección de correo recibe 10.000 caracteres nuevos. No es elegante, pero técnicamente está dentro de las condiciones de servicio para proyectos personales. Evita este método para trabajos comerciales.
3. Genera en lotes al principio del mes. Tu cuota se reinicia en la fecha de aniversario de tu cuenta. Si generas el día 1, tienes el mes calendario completo antes de que llegue el siguiente reinicio.
PicassoIA: voces de ElevenLabs sin el límite mensual
Esta es la parte que la mayoría de los usuarios de ElevenLabs no conoce. PicassoIA ejecuta los propios modelos de ElevenLabs directamente en su plataforma, junto con una biblioteca de motores de TTS competidores. En lugar de chocar con un tope mensual de caracteres, pagas por generación, lo que resulta mucho más barato para un uso esporádico o de alto volumen.
ElevenLabs v3 en PicassoIA
ElevenLabs v3 es el modelo más expresivo de ElevenLabs, con un rango emocional amplio y la prosodia más natural de todas las versiones. En PicassoIA lo usas directamente, sin necesidad de una cuenta de ElevenLabs ni de vigilar tu contador mensual. Es la mejor opción para narraciones de formato largo, diálogos de personajes o cualquier contenido en el que la emoción de la voz transmita el mensaje.
ElevenLabs v2 Multilingual
ElevenLabs v2 Multilingual admite más de 30 idiomas con una calidad de acento constante. Si tu contenido se dirige a audiencias que no hablan inglés, este modelo gestiona el español, el francés, el alemán, el portugués, el japonés, el coreano y más, sin el acento que se filtra de un idioma a otro, algo que afecta a muchos sistemas de TTS multilingües.
ElevenLabs Flash v2.5 para velocidad
Cuando el tiempo de respuesta importa más que la máxima calidad emocional, ElevenLabs Flash v2.5 ofrece una síntesis casi instantánea con una latencia muy baja. Está pensado para aplicaciones en tiempo real: traducción en vivo, apps interactivas y escenarios de streaming. La calidad de la salida sigue siendo excelente, solo que no alcanza la profundidad emocional completa de v3.
ElevenLabs Turbo v2.5 se sitúa entre Flash y v3 completo en la contrapartida entre velocidad y calidad, admite 32 idiomas y genera más rápido que el modelo estándar.
Otros modelos de TTS destacados en PicassoIA
ElevenLabs no es la única opción sólida de la colección. Varios modelos la superan en áreas concretas:
Minimax Speech 2.8 HD: calidad de estudio con un ritmo de respiración especialmente natural. Excelente para audiolibros y narraciones de formato largo.
Gemini 3.1 Flash TTS: 30 voces integradas en más de 70 idiomas. El modelo de Google con la cobertura lingüística más amplia que existe.
Inworld Realtime TTS 2: latencia inferior a 100 ms para aplicaciones en vivo. El modelo más rápido de la colección para casos de uso en tiempo real.
Qwen3 TTS: clonación de voz potente con emoción controlable, desarrollado por el equipo de investigación en IA de Alibaba.
Chatterbox: síntesis de voz con control emocional de Resemble AI, con control detallado de los parámetros de felicidad, tristeza, ira y entusiasmo.
Play Dialog: optimizado para diálogos naturales con varios hablantes, ideal para conversaciones guionizadas y contenido estilo podcast.
Minimax Voice Cloning: crea una voz de IA personalizada a partir de una muestra corta, sin límite mensual de audio generado.
La generación de voz es solo la mitad de la ecuación. Si produces contenido de audio, también necesitas extraer texto de él, ya sea para subtítulos, reutilización o edición a partir de la transcripción. Los modelos de voz a texto de PicassoIA también cubren esta parte del flujo de trabajo.
GPT-4o Transcribe en PicassoIA
GPT-4o Transcribe es el mejor modelo de transcripción de OpenAI, con tasas de error de palabra de última generación en distintos acentos y niveles variables de calidad de audio. Maneja mejor el ruido de fondo, varios hablantes y el vocabulario técnico que los modelos anteriores basados en Whisper. Para clips de audio de corta a media duración, de menos de 30 minutos, es la opción por defecto.
GPT-4o Mini Transcribe ofrece una precisión comparable a un costo reducido, ideal para cargas de transcripción de gran volumen en las que procesas muchos archivos en una misma sesión.
Gemini 3 Pro para grabaciones largas
Gemini 3 Pro maneja archivos de audio largos con una ventana de contexto enorme, lo que lo convierte en la opción adecuada para entrevistas completas, reuniones grabadas o episodios de podcast de una hora. También genera transcripciones estructuradas con identificación de hablantes y marcas de tiempo.
💡 Flujo de trabajo: genera tu guion con ElevenLabs v3 o Minimax Speech 2.8 HD, produce tu contenido y luego pasa Gemini 3 Pro por el audio terminado para crear una transcripción con subtítulos para accesibilidad y SEO.
Empieza a generar voces reales ahora mismo
El plan gratuito de ElevenLabs es una herramienta real con una calidad de salida real. El límite de 10.000 caracteres es el techo honesto, no una vista previa recortada a propósito. Para proyectos personales, narraciones ocasionales y prototipos de API, aguanta bien. Cuando ese techo se convierta en un problema, los mismos modelos de ElevenLabs están disponibles en PicassoIA sin la aritmética del límite mensual, junto con más de 20 otros motores de TTS para todo tipo de uso.
El punto de fondo es que la calidad de la voz de IA ha superado el modelo mental que la mayoría de la gente tiene de cómo suena la síntesis de voz. La barrera para la narración profesional, el contenido multilingüe y las voces realistas de personajes es hoy una cuestión de saber qué modelo elegir y dónde acceder a él.