ElevenLabs lanzó Eleven v4 y v4 Turbo el 28 de septiembre de 2026. Este artículo desglosa los más de 90 idiomas, las etiquetas de audio apilables, la clonación de voz desde 10 segundos, los nuevos ID de modelo, la latencia y los precios, y luego muestra cómo redactar guiones con ElevenLabs v3 en PicassoIA hoy mismo.
El 28 de septiembre de 2026, ElevenLabs presentó dos modelos de voz a la vez: Eleven v4 y Eleven v4 Turbo. Si desarrollas funciones de voz, narras videos o produces un podcast, la versión corta es esta: más idiomas, etiquetas de audio que puedes apilar, un límite de solicitud más largo y un modelo rápido pensado para agentes de voz en directo. La versión larga está más abajo, con las cifras, los cambios en la API y una forma práctica de ensayar tus guiones hoy.
💡 Aviso: ElevenLabs tiene en marcha un descuento de lanzamiento de dos semanas en la API que termina el 12 de octubre de 2026. Si piensas probar v4 con mucho volumen, esa fecha importa más que cualquier función de esta página.
Qué es realmente Eleven v4
ElevenLabs anunció los dos modelos el mismo día, y ambos están disponibles en su plataforma de agentes, en su estudio creativo y en la API pública. La propuesta es sencilla: voces que suenan a una persona interpretando, no a una persona leyendo.
Eleven v4 es el modelo expresivo. Es el que conviene usar cuando la interpretación importa: audiolibros, tráileres, diálogos de personajes, anuncios. Eleven v4 Turbo sacrifica un poco de matiz a cambio de velocidad. Está pensado para agentes de voz, el tipo de producto en el que una pausa de medio segundo hace que quien llama se pregunte si la línea se cortó.
Ambos siguen a Eleven v3, que ya admitía etiquetas de audio en línea. v4 mantiene esa idea y ataca los puntos débiles: voces que se desvían en lecturas largas, una lista de idiomas que se quedaba en unos 70 y ninguna compatibilidad con los Professional Voice Clones.
Estas cifras proceden de la entrada de lanzamiento de ElevenLabs, de su documentación de modelos y de reportajes de prensa de la primera semana. Cuando falta un dato, es porque la empresa no lo ha publicado, y lo he marcado como no publicado en lugar de adivinarlo.
Voces que se mantienen coherentes
Etiquetas de audio que puedes apilar
La función estrella es la dirección. Escribes etiquetas en línea, entre corchetes, y el modelo las interpreta. ElevenLabs da ejemplos como [laughs], [said angrily in French accent], [light rain] y [phone buzzing]. Fíjate en que la lista mezcla emoción, acento y efectos de sonido en una sola sintaxis.
La novedad es el apilado. Según TechCrunch, ahora puedes poner varias etiquetas seguidas y el modelo sigue la secuencia en lugar de descartar todas menos una. Una línea podría verse así:
[whispers] The door was already open. [footsteps] [light rain] Somebody had been here.
Es una ilustración del estilo, no una copia de la documentación, así que prueba tu propia redacción. Las etiquetas cortas y concretas suelen dar mejor resultado que las poéticas.
Coherencia en guiones largos
Si alguna vez has generado un capítulo por partes, conoces el problema. La línea 40 suena a otro narrador que la línea 3. ElevenLabs asegura que v4 lee el tono, el ritmo y el contexto de todo el guion y mantiene la voz estable, incluso cuando regeneras una sola línea más tarde.
Hay una cifra asociada. The Decoder informa de una puntuación de pronunciación de 91,7 por ciento para v4 frente a 85,6 por ciento para v3. Es una cifra del proveedor, así que tómala como una pista sobre la dirección y no como una promesa sobre tu guion.
💡 Consejo: Las producciones largas necesitan un plan para las repeticiones. Genera por párrafo, mantén cada párrafo por debajo del límite de caracteres y vuelve a renderizar solo las líneas que no te gusten. La coherencia de v4 pretende que ese flujo de trabajo sea seguro.
Más de 90 idiomas y acentos
La lista de idiomas crece de unos 70 a más de 90. TechCrunch señala mejoras de calidad visibles en japonés, portugués de Brasil, mandarín y cantonés, y los reportajes de prensa mencionan idiomas recién admitidos como el mongol y el odia.
Hay un detalle que pasa desapercibido. Las voces clonadas que hablan otro idioma conservan un acento nativo en ese idioma y no vuelven hacia el acento del hablante original a medida que avanza el texto. Para quien localiza la voz de una marca, esa es la diferencia entre una lectura en español creíble y una lectura estadounidense con palabras en español.
En cuanto a las clasificaciones externas, ElevenLabs afirma que v4 ocupa el primer puesto en una clasificación independiente de voz, con una puntuación Elo de 1319 recogida en artículos de lanzamiento. En pruebas a ciegas, la empresa cita que alrededor del 75 por ciento de los oyentes prefieren v4 frente a modelos competidores, mientras que The Decoder sitúa el rango entre el 65 y el 81 por ciento según el competidor.
💡 Baño de realidad: Las tablas de clasificación usan frases de prueba cortas. Ejecuta tu propio guion, en tu propio idioma, antes de comprometer un proyecto con cualquier modelo.
La clonación de voz mejora
Clones instantáneos desde 10 segundos
Los Instant Voice Clones solo necesitan 10 segundos de audio. ElevenLabs dice que la nueva arquitectura hace la clonación más rápida y mantiene mejor la identidad de la voz a lo largo de un pasaje más largo. Una biblioteca de voces más grande también ayuda: los artículos de lanzamiento mencionan más de 17.500 voces entre las que elegir.
La calidad de esa muestra de 10 segundos decide buena parte del resultado. Graba en una habitación silenciosa, sin música ni ruido de ventilador, mantén la misma distancia del micrófono durante toda la grabación y habla a tu ritmo natural en lugar de interpretar. Una muestra limpia y neutra siempre gana a una enérgica y con ruido.
Vuelven los clones profesionales
v3 no admitía los Professional Voice Clones. v4 sí, y está pensado para los trabajos de máxima fidelidad: un narrador cuya voz clonada leerá cientos de horas de audio.
Cada clon exige el consentimiento verificado del propietario de la voz. No es una nota al pie. Si clonas una voz para un cliente, consigue el permiso por escrito antes de subir un solo segundo de audio.
Qué cambia para los desarrolladores de la API
ID de modelo y límites
Cambiar de modelo es un cambio de un solo campo. Según la documentación de ElevenLabs, el cuerpo de la solicitud mantiene su forma y solo cambia model_id:
{
"text": "[laughs] That is not what the invoice said.",
"model_id": "eleven_v4"
}
Usa eleven_v4_turbo para la versión de baja latencia. El límite por solicitud es de 10.000 caracteres, que ElevenLabs equipara con unos diez minutos de audio, el doble de los 5.000 caracteres permitidos para eleven_v3. La salida llega en MP3, WAV/PCM o µ-law, y se admite streaming bidireccional por WebSocket, lo que importa si tu texto llega token a token desde un modelo de lenguaje.
Los modelos anteriores siguen disponibles. Según la documentación, eleven_flash_v2_5 admite 40.000 caracteres por solicitud en 32 idiomas a unos 75 ms, y eleven_multilingual_v2 admite 29 idiomas. Aún puedes usar ambos en PicassoIA a través de Flash v2.5 y v2 Multilingual.
Latencia y streaming
Turbo es el gran protagonista aquí. ElevenLabs informa de un tiempo mediano hasta la primera voz de unos 150 ms y una latencia mediana de inferencia de unos 100 ms. The Decoder lo compara con los 262 ms de Cartesia Sonic 3.6.
Para los agentes de voz, la afirmación más interesante es la de los tiempos. El modelo puede empezar a producir audio en cuanto el modelo de lenguaje que tiene detrás empieza a producir su respuesta, de modo que quien llama oye la respuesta mientras el resto aún se está escribiendo.
Dos advertencias. ElevenLabs no publicó una cifra de latencia para v4 estándar, y todavía no han aparecido pruebas independientes de latencia. Mide desde tu propia región, con la sobrecarga de tu propia red, porque cada cifra del proveedor la excluye.
Precios y la fecha límite del 12 de octubre
El precio de lista por millón de caracteres es de 80 $ para v4 y 40 $ para v4 Turbo. Hasta el 12 de octubre de 2026, la oferta de lanzamiento baja esas cifras a 22 $ y 11 $. Esto es lo que cuestan 100.000 caracteres, unos 100 minutos de voz, en cada caso:
Modelo
Precio de lista
Precio de lanzamiento
100.000 caracteres a precio de lista
100.000 caracteres a precio de lanzamiento
Eleven v4
80 $ por millón
22 $ por millón
8,00 $
2,20 $
Eleven v4 Turbo
40 $ por millón
11 $ por millón
4,00 $
1,10 $
Si estás evaluando, el descuento te permite hacer una prueba comparativa real a bajo costo. Si estás presupuestando un producto, planifica con el precio de lista, porque es lo que pagarás cuando termine la oferta.
Qué modelo para cada trabajo
La elección correcta depende de para qué sirve el audio, no de cuál es el modelo más nuevo.
Trabajo
Mejor opción
Por qué
Audiolibro o narración larga
Eleven v4
Coherencia de la voz y un límite de 10.000 caracteres
Un reparto práctico para equipos pequeños: redacta en un modelo más rápido y barato mientras el guion aún cambia, y renderiza el audio final en el expresivo. El trabajo de voz se encarece cuando regeneras un capítulo entero después de cada edición, así que fija primero las palabras y gasta los caracteres premium al final. Si tu producto combina ambas necesidades, por ejemplo un curso narrado con un asistente de preguntas y respuestas en directo, puedes usar v4 para las lecciones y Turbo para el asistente, ya que ambos comparten el mismo formato de solicitud.
3 errores habituales
Juzgar con una sola frase. Una línea de demostración no dice nada sobre un capítulo de 40 párrafos. Prueba tu guion más largo y más complicado.
Usar el modelo expresivo para un agente en directo. Si alguien está esperando al otro lado de la línea, Turbo es la herramienta adecuada aunque v4 suene un poco más rico.
Presupuestar con el precio de lanzamiento. El descuento termina el 12 de octubre de 2026. Calcula tu proyecto con 80 $ y 40 $ por millón de caracteres.
Cómo usar ElevenLabs v3 en PicassoIA
Al escribir este artículo, v4 no está en el catálogo de PicassoIA. ElevenLabs v3 sí está, y es su pariente más cercano: la misma familia y el mismo hábito de interpretar la dirección en línea. Eso lo convierte en un buen lugar para redactar guiones y probar voces mientras v4 llega a más plataformas.
Elige una voz de la lista de 26 opciones. La predeterminada es Rachel; entre las demás están Aria, Roger, Sarah y James.
Define el código de idioma, por ejemplo en, es o fr.
Deja los controles deslizantes en sus valores predeterminados para la primera prueba, pulsa generar y escucha.
Ajusta un solo parámetro cada vez y vuelve a generar. Cambiar tres cosas a la vez no te dice nada.
Ajustes que importan
Ajuste
Rango
Predeterminado
Qué hace
Velocidad
0,25 a 4,0
1
Ritmo de toda la lectura
Estilo
0,0 a 1,0
0
Lleva la entrega de neutra hacia teatral
Estabilidad
0,0 a 1,0
0,5
Un valor más alto mantiene la voz más estable a lo largo de un guion largo
Refuerzo de similitud
0,0 a 1,0
0,75
Hasta qué punto la salida se ajusta a la voz elegida
Texto anterior / Texto siguiente
Texto
Vacío
Da contexto al modelo para que la entonación encaje en los límites de las frases
Dos hábitos te ahorrarán tiempo. Primero, pega el párrafo anterior y el siguiente de tu párrafo actual en los campos de contexto, para que cada fragmento generado se una bien a sus vecinos. Segundo, prueba etiquetas entre corchetes como [whispers] en el prompt y escucha cómo las interpreta el modelo. Es el mismo estilo de dirección en el que se basa v4, así que la práctica te sirve también ahí.
Un modelo de voz rara vez trabaja solo. La mayoría de los proyectos que necesitan narración también necesitan una base musical, una transcripción o una versión traducida. Las tres cosas están en PicassoIA.
Componer con ElevenLabs Music
ElevenLabs Music convierte un prompt de texto en una canción. Para trabajos de narración, pide algo instrumental, constante y con poco volumen en la mezcla. Describe el ambiente, el tempo y los instrumentos con palabras sencillas, como "slow acoustic guitar, warm room, no vocals, 70 BPM". Si quieres comparar, Lyria 3 Pro y Music 2.6 aceptan el mismo tipo de prompt.
Transcribir con GPT-4o o Gemini
Una vez que existe la narración, necesitas subtítulos y un registro de texto. GPT-4o Transcribe convierte audio en texto, y GPT-4o Mini Transcribe es la opción más ligera para borradores rápidos. Gemini 3 Pro es una tercera vía, útil si quieres comparar cómo gestiona cada modelo los nombres y los números.
Un truco útil: transcribe tu narración generada y compárala con el guion original. Cualquier diferencia señala una palabra en la que la voz tropezó, y puedes corregirla con un cambio ortográfico o una indicación de pronunciación.
Doblar videos a más de 90 idiomas
ElevenLabs Dubbing toma un video terminado y produce versiones en otros idiomas. Encaja de forma natural con la lista de idiomas más amplia de v4, ya que la localización es donde la coherencia de la voz rinde más.
Te toca experimentar
La mejor forma de juzgar un modelo de voz es darle tu guion y escucharlo. No necesitas un estudio, una partida presupuestaria ni una semana de preparación para empezar.
Aquí tienes un plan para una tarde:
Escribe un guion de 150 palabras con un giro emocional en el medio.
Renderiza el guion en ElevenLabs v3 con tres voces distintas y un cambio en el control deslizante de estilo.
Transcribe el resultado con GPT-4o Transcribe y compara las palabras con tu guion.
Cuando v4 llegue a la plataforma que elijas, ya sabrás qué etiquetas, voces y ajustes encajan con tu material, y podrás presupuestar con los precios de lista con confianza.
Abre Picasso IA y prueba tu primer guion hoy. Elige una voz, añade una etiqueta apilada y escucha la diferencia que marca la dirección.