Cómo usar ElevenLabs para generar voces gratis sin gastar ni un centavo

Una guía completa de las herramientas gratuitas de generación de voz de ElevenLabs: configuración de la cuenta, límites mensuales de caracteres, clonación de voz instantánea, integración con la API y las mejores alternativas gratuitas cuando 10.000 caracteres al mes no son suficientes.

Cómo usar ElevenLabs para generar voces gratis sin gastar ni un centavo
Cristian Da Conceicao
Fundador de Picasso IA

La distancia entre la síntesis de voz robótica y las voces que de verdad engañan a la gente se cerró hace un par de años. ElevenLabs hizo mucho más que cerrarla: amplió el camino del otro lado. El problema es que la mayoría de la gente llega al tope del plan gratuito antes de descubrir lo que esta tecnología puede hacer de verdad. Este artículo explica paso a paso cómo usar ElevenLabs para generar voces gratis, qué significan en la práctica los límites y adónde ir cuando 10.000 caracteres al mes no son suficientes.

Qué incluye realmente el plan gratuito de ElevenLabs

ElevenLabs ofrece un nivel gratuito que es de verdad útil, no solo una demo. Esto es lo que obtienes sin introducir una tarjeta de crédito:

La cuota de caracteres

El plan gratuito incluye 10.000 caracteres al mes. Suena a mucho. En términos reales, 10.000 caracteres equivalen aproximadamente a:

  • De 1.500 a 1.700 palabras de contenido narrado
  • Un episodio de podcast de 7 a 10 minutos
  • Unas 12 a 15 locuciones cortas para redes sociales (de 60 a 80 palabras cada una)

Cuando agotas esos caracteres, la generación se detiene hasta el reinicio mensual. El contador se reinicia el mismo día del calendario en que creaste tu cuenta, no el día 1 del mes.

Opciones de voz sin costo

El plan gratuito te da acceso a:

  • Más de 30 voces predefinidas de distintas edades, géneros y acentos
  • Clonación de voz instantánea: hasta 3 voces personalizadas
  • 10 idiomas para la generación estándar
  • Audio de calidad estándar (MP3 a 128 kbps)

Lo que el nivel gratuito NO incluye: clonación de voz profesional (modelo de alta fidelidad), derechos de licencia comercial, Projects (la herramienta para audiolibros de formato largo), Dubbing y formatos de audio de mayor calidad como PCM o FLAC.

Lo que no puedes hacer gratis

FunciónGratisStarter (5 $/mes)Creator (22 $/mes)
Caracteres al mes10.00030.000100.000
Licencia comercialNoSíSí
Clonación de voz profesionalNoNoSí
Calidad de audio128 kbps192 kbps192 kbps
Herramienta ProjectsNoNoSí

La falta de licencia comercial es la limitación más importante. Todo lo que generes con el plan gratuito técnicamente no puede usarse en productos de pago, trabajos para clientes ni contenido monetizado.

Cómo configurar tu cuenta gratuita de ElevenLabs

La configuración lleva unos dos minutos.

Mujer registrándose en una cuenta en un equipo portátil sobre un escritorio de madera color crema

Creación de la cuenta paso a paso

  1. Ve a elevenlabs.io y haz clic en Sign Up
  2. Introduce tu correo electrónico o usa OAuth con Google o GitHub
  3. Confirma tu correo a través del enlace de verificación
  4. Inicia sesión y llegarás directamente a la página de Speech Synthesis

En este paso no se pide tarjeta de crédito. La plataforma no solicita datos de pago hasta que decidas mejorar el plan.

Elegir tu primera voz

La biblioteca de voces del panel izquierdo se ordena por:

  • Género: Masculino, Femenino, No binario
  • Edad: Joven, De mediana edad, Mayor
  • Acento: Estadounidense, Británico, Australiano, Indio y más
  • Uso: Narración, Noticias, Conversacional, Personajes

💡 Filtra por "Conversational" para contenido en redes sociales y por "Narration" para guiones de formato largo. La categoría "News" suele sonar la más neutral y con mayor autoridad para contenido informativo.

Generar tu primera voz gratis

Panel de cuota de audio en la pantalla de un MacBook sobre un escritorio color crema

La interfaz de texto a voz

La interfaz principal es sencilla. Pega tu guion en el área de texto grande, selecciona una voz en la barra lateral y pulsa Generate. El verdadero matiz está en el panel de ajustes debajo del cuadro de texto:

  • Stability: controla lo constante que suena la voz de una frase a otra. Un valor bajo significa más expresividad y uno alto, más monotonía. Un valor de 0,5 a 0,65 es un buen punto de partida.
  • Similarity Enhancement: lo fiel que es la salida a la muestra de voz original. Mantenlo por encima de 0,75 para obtener mejores resultados.
  • Style Exaggeration: amplifica el estilo natural de la voz. Útil para narraciones dramáticas, arriesgado para contenido empresarial.

Ajustar los ajustes de voz

La mayoría de los principiantes ignora estos controles y luego se pregunta por qué la voz suena plana. Stability es el que más influye. Si tu voz suena robótica y uniforme, bájala hacia 0,4. Si suena errática e impredecible, súbela hacia 0,8.

💡 Añade pausas naturales a tu guion con puntos suspensivos ... o con un punto seguido de un espacio. En los planes de pago funciona la sintaxis SSML, como <break time="1.0s" />, pero estos sencillos trucos de puntuación también son eficaces en el plan gratuito.

Descargar tu archivo de audio

Después de generar, aparece un reproductor de audio verde debajo del cuadro de texto. Haz clic en el icono Download (una flecha hacia abajo) para guardar el archivo en MP3. El archivo se nombra con una marca de tiempo. No hay descarga masiva, así que si generaste 10 clips, los descargas uno a uno.

Clonación de voz gratuita en ElevenLabs

Hombre hablando frente a un micrófono de condensador de gran diafragma en un estudio de grabación

La clonación de voz es lo que le da a ElevenLabs su reputación. Incluso el plan gratuito te da la clonación de voz instantánea, que impresiona más de lo que la mayoría de la gente espera.

Lo básico de la clonación de voz instantánea

La clonación de voz instantánea (IVC) crea un modelo de voz a partir de una muestra de audio que subes. No es tan precisa como el modelo de clonación de voz profesional (que requiere más de 30 minutos de audio limpio y es una función de pago), pero para la mayoría de los casos es más que suficiente.

Ve a Voices > Add Voice > Instant Voice Clone y luego sube:

  • Un archivo WAV o MP3
  • Entre 30 segundos y 5 minutos de audio limpio
  • Un solo hablante con un mínimo de ruido de fondo
  • Un ritmo de lectura natural funciona mejor que el habla conversacional

Lo que necesitas

La calidad de tu clon depende por completo de la calidad de tu audio de origen. Una grabación hecha con un teléfono en una habitación silenciosa vence a una grabación profesional en un espacio con eco. La música de fondo es lo que más arruina la precisión del clon.

💡 Graba en un armario rodeado de ropa colgada. La tela absorbe los reflejos acústicos mejor que la mayoría de los paneles de espuma y no cuesta nada.

Límites del plan gratuito

En el plan gratuito puedes crear hasta 3 voces clonadas. Para crear una 4.ª, tienes que eliminar una de las tres existentes. Los clones se guardan solo en tu cuenta y no se pueden compartir públicamente. El audio generado con una voz clonada consume tu cuota mensual de 10.000 caracteres igual que las voces predefinidas.

Usar la API de ElevenLabs gratis

Desarrollador frente a una estación de trabajo con dos monitores y código de API en las pantallas

El plan gratuito incluye acceso a la API. Esto sorprende a muchos desarrolladores que dan por hecho que las APIs siempre están detrás de un muro de pago.

Límites de la API gratuita

Tu clave de API gratuita comparte la misma cuota de 10.000 caracteres mensuales que la interfaz web. No hay una asignación separada para la API. Cada carácter generado a través de la API reduce lo que puedes generar en el navegador, y viceversa.

El endpoint de la API para texto a voz es:

POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}

La autenticación usa la cabecera xi-api-key con tu clave, que encuentras en la página Profile Settings.

Configuración en Python y JavaScript

Python:

import requests

url = "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID"
headers = {
    "xi-api-key": "YOUR_API_KEY",
    "Content-Type": "application/json"
}
payload = {
    "text": "Your script here",
    "model_id": "eleven_multilingual_v2",
    "voice_settings": {"stability": 0.6, "similarity_boost": 0.8}
}
response = requests.post(url, json=payload, headers=headers)
with open("output.mp3", "wb") as f:
    f.write(response.content)

JavaScript (Node.js):

const response = await fetch(
  `https://api.elevenlabs.io/v1/text-to-speech/${voiceId}`,
  {
    method: 'POST',
    headers: { 'xi-api-key': apiKey, 'Content-Type': 'application/json' },
    body: JSON.stringify({ text: script, model_id: 'eleven_multilingual_v2' })
  }
);
const buffer = await response.arrayBuffer();

Mejores casos de uso dentro del límite gratuito

El acceso a la API sin costo es práctico para:

  • Prototipos: prueba la integración de voz en tu app antes de comprometerte con un plan de pago
  • Automatización de bajo volumen: un script que genera una locución diaria para una herramienta interna
  • Proyectos personales: clips de introducción de podcast, sonidos de notificación, apps de asistente personal

No construyas un producto de cara al cliente en producción sobre la API gratuita. El límite de 10.000 caracteres es un corte firme, sin período de gracia.

Cuando 10.000 caracteres no son suficientes

Dos amigos escuchando audio juntos en una cafetería con un MacBook

La mayoría de la gente alcanza el límite gratuito antes de lo que espera. Aquí tienes cómo calcular tus necesidades mensuales reales y tres formas de estirar tu cuota.

Calcular tus necesidades mensuales

Cuenta los caracteres de tus guiones, no las palabras. Una palabra media en inglés tiene unos 5 caracteres, contando el espacio que la sigue.

Tipo de contenidoLongitud mediaCaracteres usados
Clip de redes sociales de 60 segundos~130 palabras~780 caracteres
Narración de YouTube de 5 minutos~700 palabras~4.200 caracteres
Episodio de podcast de 10 minutos~1.400 palabras~8.400 caracteres
Capítulo completo de audiolibro~3.500 palabras~21.000 caracteres

Un solo episodio de podcast de 10 minutos consume el 84 % de tu cuota mensual gratuita. Con dos episodios, te quedarás sin cuota antes de que termine la segunda semana del mes.

Tres formas de estirar el plan gratuito

1. Escribe guiones más ajustados. Elimina las palabras de relleno antes de generar. Cada cláusula innecesaria gasta caracteres. Edita primero, genera después.

2. Crea varias cuentas gratuitas. Cada nueva dirección de correo recibe 10.000 caracteres nuevos. No es elegante, pero técnicamente está dentro de las condiciones de servicio para proyectos personales. Evita este método para trabajos comerciales.

3. Genera en lotes al principio del mes. Tu cuota se reinicia en la fecha de aniversario de tu cuenta. Si generas el día 1, tienes el mes calendario completo antes de que llegue el siguiente reinicio.

PicassoIA: voces de ElevenLabs sin el límite mensual

Mujer joven escuchando con auriculares en un sofá color crema con un equipo portátil

Esta es la parte que la mayoría de los usuarios de ElevenLabs no conoce. PicassoIA ejecuta los propios modelos de ElevenLabs directamente en su plataforma, junto con una biblioteca de motores de TTS competidores. En lugar de chocar con un tope mensual de caracteres, pagas por generación, lo que resulta mucho más barato para un uso esporádico o de alto volumen.

ElevenLabs v3 en PicassoIA

ElevenLabs v3 es el modelo más expresivo de ElevenLabs, con un rango emocional amplio y la prosodia más natural de todas las versiones. En PicassoIA lo usas directamente, sin necesidad de una cuenta de ElevenLabs ni de vigilar tu contador mensual. Es la mejor opción para narraciones de formato largo, diálogos de personajes o cualquier contenido en el que la emoción de la voz transmita el mensaje.

ElevenLabs v2 Multilingual

ElevenLabs v2 Multilingual admite más de 30 idiomas con una calidad de acento constante. Si tu contenido se dirige a audiencias que no hablan inglés, este modelo gestiona el español, el francés, el alemán, el portugués, el japonés, el coreano y más, sin el acento que se filtra de un idioma a otro, algo que afecta a muchos sistemas de TTS multilingües.

Vista cenital de un escritorio con la interfaz de selección de modelos de voz en un equipo portátil

ElevenLabs Flash v2.5 para velocidad

Cuando el tiempo de respuesta importa más que la máxima calidad emocional, ElevenLabs Flash v2.5 ofrece una síntesis casi instantánea con una latencia muy baja. Está pensado para aplicaciones en tiempo real: traducción en vivo, apps interactivas y escenarios de streaming. La calidad de la salida sigue siendo excelente, solo que no alcanza la profundidad emocional completa de v3.

ElevenLabs Turbo v2.5 se sitúa entre Flash y v3 completo en la contrapartida entre velocidad y calidad, admite 32 idiomas y genera más rápido que el modelo estándar.

Otros modelos de TTS destacados en PicassoIA

ElevenLabs no es la única opción sólida de la colección. Varios modelos la superan en áreas concretas:

  • Minimax Speech 2.8 HD: calidad de estudio con un ritmo de respiración especialmente natural. Excelente para audiolibros y narraciones de formato largo.
  • Gemini 3.1 Flash TTS: 30 voces integradas en más de 70 idiomas. El modelo de Google con la cobertura lingüística más amplia que existe.
  • Inworld Realtime TTS 2: latencia inferior a 100 ms para aplicaciones en vivo. El modelo más rápido de la colección para casos de uso en tiempo real.
  • Qwen3 TTS: clonación de voz potente con emoción controlable, desarrollado por el equipo de investigación en IA de Alibaba.
  • Chatterbox: síntesis de voz con control emocional de Resemble AI, con control detallado de los parámetros de felicidad, tristeza, ira y entusiasmo.
  • Play Dialog: optimizado para diálogos naturales con varios hablantes, ideal para conversaciones guionizadas y contenido estilo podcast.
  • Minimax Voice Cloning: crea una voz de IA personalizada a partir de una muestra corta, sin límite mensual de audio generado.

💡 Cuándo usar cada uno: ElevenLabs v3 para narración emocional en inglés. Gemini 3.1 Flash TTS para proyectos multilingües a gran escala. Inworld Realtime TTS 2 para aplicaciones en vivo y en tiempo real. Minimax Speech 2.8 HD para resultados de calidad de audiolibro.

Transcribir audio gratis también

Smartphone en la mano al aire libre mostrando una visualización de onda de audio

La generación de voz es solo la mitad de la ecuación. Si produces contenido de audio, también necesitas extraer texto de él, ya sea para subtítulos, reutilización o edición a partir de la transcripción. Los modelos de voz a texto de PicassoIA también cubren esta parte del flujo de trabajo.

GPT-4o Transcribe en PicassoIA

GPT-4o Transcribe es el mejor modelo de transcripción de OpenAI, con tasas de error de palabra de última generación en distintos acentos y niveles variables de calidad de audio. Maneja mejor el ruido de fondo, varios hablantes y el vocabulario técnico que los modelos anteriores basados en Whisper. Para clips de audio de corta a media duración, de menos de 30 minutos, es la opción por defecto.

GPT-4o Mini Transcribe ofrece una precisión comparable a un costo reducido, ideal para cargas de transcripción de gran volumen en las que procesas muchos archivos en una misma sesión.

Gemini 3 Pro para grabaciones largas

Gemini 3 Pro maneja archivos de audio largos con una ventana de contexto enorme, lo que lo convierte en la opción adecuada para entrevistas completas, reuniones grabadas o episodios de podcast de una hora. También genera transcripciones estructuradas con identificación de hablantes y marcas de tiempo.

💡 Flujo de trabajo: genera tu guion con ElevenLabs v3 o Minimax Speech 2.8 HD, produce tu contenido y luego pasa Gemini 3 Pro por el audio terminado para crear una transcripción con subtítulos para accesibilidad y SEO.

Empieza a generar voces reales ahora mismo

Hombre profesional y seguro de sí mismo con auriculares alrededor del cuello junto a una ventana de oficina sosteniendo un café

El plan gratuito de ElevenLabs es una herramienta real con una calidad de salida real. El límite de 10.000 caracteres es el techo honesto, no una vista previa recortada a propósito. Para proyectos personales, narraciones ocasionales y prototipos de API, aguanta bien. Cuando ese techo se convierta en un problema, los mismos modelos de ElevenLabs están disponibles en PicassoIA sin la aritmética del límite mensual, junto con más de 20 otros motores de TTS para todo tipo de uso.

El punto de fondo es que la calidad de la voz de IA ha superado el modelo mental que la mayoría de la gente tiene de cómo suena la síntesis de voz. La barrera para la narración profesional, el contenido multilingüe y las voces realistas de personajes es hoy una cuestión de saber qué modelo elegir y dónde acceder a él.

PicassoIA reúne más de 23 modelos de texto a voz, desde ElevenLabs v3 y Flash v2.5 hasta Minimax Speech 2.8 HD, Inworld Realtime TTS 2, Gemini 3.1 Flash TTS y Chatterbox, junto con tres modelos de voz a texto para transcripción. Explora la colección completa en picassoia.com/en/all-models y genera un clip de voz que antes habría requerido un estudio profesional.

Compartir este artículo

Elige tu idioma