ElevenLabs v4: novedades en voces y en la API

ElevenLabs lanzó Eleven v4 y v4 Turbo el 28 de septiembre de 2026. Este artículo desglosa los más de 90 idiomas, las etiquetas de audio apilables, la clonación de voz desde 10 segundos, los nuevos ID de modelo, la latencia y los precios, y luego muestra cómo redactar guiones con ElevenLabs v3 en PicassoIA hoy mismo.

ElevenLabs v4: novedades en voces y en la API
Cristian Da Conceicao
Fundador de Picasso IA

El 28 de septiembre de 2026, ElevenLabs presentó dos modelos de voz a la vez: Eleven v4 y Eleven v4 Turbo. Si desarrollas funciones de voz, narras videos o produces un podcast, la versión corta es esta: más idiomas, etiquetas de audio que puedes apilar, un límite de solicitud más largo y un modelo rápido pensado para agentes de voz en directo. La versión larga está más abajo, con las cifras, los cambios en la API y una forma práctica de ensayar tus guiones hoy.

💡 Aviso: ElevenLabs tiene en marcha un descuento de lanzamiento de dos semanas en la API que termina el 12 de octubre de 2026. Si piensas probar v4 con mucho volumen, esa fecha importa más que cualquier función de esta página.

Qué es realmente Eleven v4

ElevenLabs anunció los dos modelos el mismo día, y ambos están disponibles en su plataforma de agentes, en su estudio creativo y en la API pública. La propuesta es sencilla: voces que suenan a una persona interpretando, no a una persona leyendo.

Eleven v4 es el modelo expresivo. Es el que conviene usar cuando la interpretación importa: audiolibros, tráileres, diálogos de personajes, anuncios. Eleven v4 Turbo sacrifica un poco de matiz a cambio de velocidad. Está pensado para agentes de voz, el tipo de producto en el que una pausa de medio segundo hace que quien llama se pregunte si la línea se cortó.

Ambos siguen a Eleven v3, que ya admitía etiquetas de audio en línea. v4 mantiene esa idea y ataca los puntos débiles: voces que se desvían en lecturas largas, una lista de idiomas que se quedaba en unos 70 y ninguna compatibilidad con los Professional Voice Clones.

Un escritorio con un equipo portátil, un guion impreso, auriculares y café visto desde arriba

Las cifras de un vistazo

EspecificaciónEleven v3Eleven v4Eleven v4 Turbo
ID de modelo de la APIeleven_v3eleven_v4eleven_v4_turbo
IdiomasMás de 70Más de 90Más de 90
Caracteres por solicitud5.00010.000No publicado
VelocidadEstándarEstándarUnos 150 ms hasta la primera voz
Pensado paraNarración expresivaNarración expresiva, lecturas largasAgentes de voz en directo

Estas cifras proceden de la entrada de lanzamiento de ElevenLabs, de su documentación de modelos y de reportajes de prensa de la primera semana. Cuando falta un dato, es porque la empresa no lo ha publicado, y lo he marcado como no publicado en lugar de adivinarlo.

Voces que se mantienen coherentes

Etiquetas de audio que puedes apilar

La función estrella es la dirección. Escribes etiquetas en línea, entre corchetes, y el modelo las interpreta. ElevenLabs da ejemplos como [laughs], [said angrily in French accent], [light rain] y [phone buzzing]. Fíjate en que la lista mezcla emoción, acento y efectos de sonido en una sola sintaxis.

La novedad es el apilado. Según TechCrunch, ahora puedes poner varias etiquetas seguidas y el modelo sigue la secuencia en lugar de descartar todas menos una. Una línea podría verse así:

[whispers] The door was already open. [footsteps] [light rain] Somebody had been here.

Es una ilustración del estilo, no una copia de la documentación, así que prueba tu propia redacción. Las etiquetas cortas y concretas suelen dar mejor resultado que las poéticas.

Coherencia en guiones largos

Si alguna vez has generado un capítulo por partes, conoces el problema. La línea 40 suena a otro narrador que la línea 3. ElevenLabs asegura que v4 lee el tono, el ritmo y el contexto de todo el guion y mantiene la voz estable, incluso cuando regeneras una sola línea más tarde.

Hay una cifra asociada. The Decoder informa de una puntuación de pronunciación de 91,7 por ciento para v4 frente a 85,6 por ciento para v3. Es una cifra del proveedor, así que tómala como una pista sobre la dirección y no como una promesa sobre tu guion.

💡 Consejo: Las producciones largas necesitan un plan para las repeticiones. Genera por párrafo, mantén cada párrafo por debajo del límite de caracteres y vuelve a renderizar solo las líneas que no te gusten. La coherencia de v4 pretende que ese flujo de trabajo sea seguro.

Un narrador masculino de mayor edad leyendo un libro impreso frente a un micrófono en una pequeña cabina de grabación

Más de 90 idiomas y acentos

La lista de idiomas crece de unos 70 a más de 90. TechCrunch señala mejoras de calidad visibles en japonés, portugués de Brasil, mandarín y cantonés, y los reportajes de prensa mencionan idiomas recién admitidos como el mongol y el odia.

Hay un detalle que pasa desapercibido. Las voces clonadas que hablan otro idioma conservan un acento nativo en ese idioma y no vuelven hacia el acento del hablante original a medida que avanza el texto. Para quien localiza la voz de una marca, esa es la diferencia entre una lectura en español creíble y una lectura estadounidense con palabras en español.

En cuanto a las clasificaciones externas, ElevenLabs afirma que v4 ocupa el primer puesto en una clasificación independiente de voz, con una puntuación Elo de 1319 recogida en artículos de lanzamiento. En pruebas a ciegas, la empresa cita que alrededor del 75 por ciento de los oyentes prefieren v4 frente a modelos competidores, mientras que The Decoder sitúa el rango entre el 65 y el 81 por ciento según el competidor.

💡 Baño de realidad: Las tablas de clasificación usan frases de prueba cortas. Ejecuta tu propio guion, en tu propio idioma, antes de comprometer un proyecto con cualquier modelo.

La clonación de voz mejora

Clones instantáneos desde 10 segundos

Los Instant Voice Clones solo necesitan 10 segundos de audio. ElevenLabs dice que la nueva arquitectura hace la clonación más rápida y mantiene mejor la identidad de la voz a lo largo de un pasaje más largo. Una biblioteca de voces más grande también ayuda: los artículos de lanzamiento mencionan más de 17.500 voces entre las que elegir.

La calidad de esa muestra de 10 segundos decide buena parte del resultado. Graba en una habitación silenciosa, sin música ni ruido de ventilador, mantén la misma distancia del micrófono durante toda la grabación y habla a tu ritmo natural en lugar de interpretar. Una muestra limpia y neutra siempre gana a una enérgica y con ruido.

Primer plano en contrapicado de un micrófono de condensador con filtro antipop en un estudio revestido de madera

Vuelven los clones profesionales

v3 no admitía los Professional Voice Clones. v4 sí, y está pensado para los trabajos de máxima fidelidad: un narrador cuya voz clonada leerá cientos de horas de audio.

Cada clon exige el consentimiento verificado del propietario de la voz. No es una nota al pie. Si clonas una voz para un cliente, consigue el permiso por escrito antes de subir un solo segundo de audio.

Qué cambia para los desarrolladores de la API

ID de modelo y límites

Cambiar de modelo es un cambio de un solo campo. Según la documentación de ElevenLabs, el cuerpo de la solicitud mantiene su forma y solo cambia model_id:

{
  "text": "[laughs] That is not what the invoice said.",
  "model_id": "eleven_v4"
}

Usa eleven_v4_turbo para la versión de baja latencia. El límite por solicitud es de 10.000 caracteres, que ElevenLabs equipara con unos diez minutos de audio, el doble de los 5.000 caracteres permitidos para eleven_v3. La salida llega en MP3, WAV/PCM o µ-law, y se admite streaming bidireccional por WebSocket, lo que importa si tu texto llega token a token desde un modelo de lenguaje.

Los modelos anteriores siguen disponibles. Según la documentación, eleven_flash_v2_5 admite 40.000 caracteres por solicitud en 32 idiomas a unos 75 ms, y eleven_multilingual_v2 admite 29 idiomas. Aún puedes usar ambos en PicassoIA a través de Flash v2.5 y v2 Multilingual.

Una desarrolladora de software escribiendo en un escritorio con dos monitores y código desenfocado en las pantallas

Latencia y streaming

Turbo es el gran protagonista aquí. ElevenLabs informa de un tiempo mediano hasta la primera voz de unos 150 ms y una latencia mediana de inferencia de unos 100 ms. The Decoder lo compara con los 262 ms de Cartesia Sonic 3.6.

Para los agentes de voz, la afirmación más interesante es la de los tiempos. El modelo puede empezar a producir audio en cuanto el modelo de lenguaje que tiene detrás empieza a producir su respuesta, de modo que quien llama oye la respuesta mientras el resto aún se está escribiendo.

Dos advertencias. ElevenLabs no publicó una cifra de latencia para v4 estándar, y todavía no han aparecido pruebas independientes de latencia. Mide desde tu propia región, con la sobrecarga de tu propia red, porque cada cifra del proveedor la excluye.

Precios y la fecha límite del 12 de octubre

El precio de lista por millón de caracteres es de 80 $ para v4 y 40 $ para v4 Turbo. Hasta el 12 de octubre de 2026, la oferta de lanzamiento baja esas cifras a 22 $ y 11 $. Esto es lo que cuestan 100.000 caracteres, unos 100 minutos de voz, en cada caso:

ModeloPrecio de listaPrecio de lanzamiento100.000 caracteres a precio de lista100.000 caracteres a precio de lanzamiento
Eleven v480 $ por millón22 $ por millón8,00 $2,20 $
Eleven v4 Turbo40 $ por millón11 $ por millón4,00 $1,10 $

Si estás evaluando, el descuento te permite hacer una prueba comparativa real a bajo costo. Si estás presupuestando un producto, planifica con el precio de lista, porque es lo que pagarás cuando termine la oferta.

Qué modelo para cada trabajo

Un agente de atención al cliente sonriente con auriculares en una oficina abierta y luminosa

La elección correcta depende de para qué sirve el audio, no de cuál es el modelo más nuevo.

TrabajoMejor opciónPor qué
Audiolibro o narración largaEleven v4Coherencia de la voz y un límite de 10.000 caracteres
Agente de voz o bot telefónicoEleven v4 TurboUnos 150 ms hasta la primera voz
Lotes masivos, baratos y multilingüesFlash v2.540.000 caracteres por solicitud y un precio más bajo
Borradores expresivos que puedes probar hoyEleven v3Disponible en PicassoIA ahora mismo
Lecturas multilingües estables y consolidadasv2 MultilingualUn modelo maduro con 29 idiomas

Un reparto práctico para equipos pequeños: redacta en un modelo más rápido y barato mientras el guion aún cambia, y renderiza el audio final en el expresivo. El trabajo de voz se encarece cuando regeneras un capítulo entero después de cada edición, así que fija primero las palabras y gasta los caracteres premium al final. Si tu producto combina ambas necesidades, por ejemplo un curso narrado con un asistente de preguntas y respuestas en directo, puedes usar v4 para las lecciones y Turbo para el asistente, ya que ambos comparten el mismo formato de solicitud.

3 errores habituales

  1. Juzgar con una sola frase. Una línea de demostración no dice nada sobre un capítulo de 40 párrafos. Prueba tu guion más largo y más complicado.
  2. Usar el modelo expresivo para un agente en directo. Si alguien está esperando al otro lado de la línea, Turbo es la herramienta adecuada aunque v4 suene un poco más rico.
  3. Presupuestar con el precio de lanzamiento. El descuento termina el 12 de octubre de 2026. Calcula tu proyecto con 80 $ y 40 $ por millón de caracteres.

Cómo usar ElevenLabs v3 en PicassoIA

Al escribir este artículo, v4 no está en el catálogo de PicassoIA. ElevenLabs v3 sí está, y es su pariente más cercano: la misma familia y el mismo hábito de interpretar la dirección en línea. Eso lo convierte en un buen lugar para redactar guiones y probar voces mientras v4 llega a más plataformas.

Paso a paso

  1. Abre la página de ElevenLabs v3 en la colección de texto a voz.
  2. Pega tu guion en el campo Prompt.
  3. Elige una voz de la lista de 26 opciones. La predeterminada es Rachel; entre las demás están Aria, Roger, Sarah y James.
  4. Define el código de idioma, por ejemplo en, es o fr.
  5. Deja los controles deslizantes en sus valores predeterminados para la primera prueba, pulsa generar y escucha.
  6. Ajusta un solo parámetro cada vez y vuelve a generar. Cambiar tres cosas a la vez no te dice nada.

Dos manos ajustando los faders de una consola de mezcla analógica

Ajustes que importan

AjusteRangoPredeterminadoQué hace
Velocidad0,25 a 4,01Ritmo de toda la lectura
Estilo0,0 a 1,00Lleva la entrega de neutra hacia teatral
Estabilidad0,0 a 1,00,5Un valor más alto mantiene la voz más estable a lo largo de un guion largo
Refuerzo de similitud0,0 a 1,00,75Hasta qué punto la salida se ajusta a la voz elegida
Texto anterior / Texto siguienteTextoVacíoDa contexto al modelo para que la entonación encaje en los límites de las frases

Dos hábitos te ahorrarán tiempo. Primero, pega el párrafo anterior y el siguiente de tu párrafo actual en los campos de contexto, para que cada fragmento generado se una bien a sus vecinos. Segundo, prueba etiquetas entre corchetes como [whispers] en el prompt y escucha cómo las interpreta el modelo. Es el mismo estilo de dirección en el que se basa v4, así que la práctica te sirve también ahí.

Para comparar otras voces, la misma colección incluye MiniMax Speech 2.8 HD, Gemini 3.1 Flash TTS e Inworld Realtime TTS 2.

Más allá de la voz: música y transcripciones

Un modelo de voz rara vez trabaja solo. La mayoría de los proyectos que necesitan narración también necesitan una base musical, una transcripción o una versión traducida. Las tres cosas están en PicassoIA.

Componer con ElevenLabs Music

ElevenLabs Music convierte un prompt de texto en una canción. Para trabajos de narración, pide algo instrumental, constante y con poco volumen en la mezcla. Describe el ambiente, el tempo y los instrumentos con palabras sencillas, como "slow acoustic guitar, warm room, no vocals, 70 BPM". Si quieres comparar, Lyria 3 Pro y Music 2.6 aceptan el mismo tipo de prompt.

Un músico junto a una guitarra acústica ajustando un sintetizador en un pequeño estudio casero

Transcribir con GPT-4o o Gemini

Una vez que existe la narración, necesitas subtítulos y un registro de texto. GPT-4o Transcribe convierte audio en texto, y GPT-4o Mini Transcribe es la opción más ligera para borradores rápidos. Gemini 3 Pro es una tercera vía, útil si quieres comparar cómo gestiona cada modelo los nombres y los números.

Un truco útil: transcribe tu narración generada y compárala con el guion original. Cualquier diferencia señala una palabra en la que la voz tropezó, y puedes corregirla con un cambio ortográfico o una indicación de pronunciación.

Doblar videos a más de 90 idiomas

ElevenLabs Dubbing toma un video terminado y produce versiones en otros idiomas. Encaja de forma natural con la lista de idiomas más amplia de v4, ya que la localización es donde la coherencia de la voz rinde más.

Una joven hablando frente a un micrófono mientras ve una escena de una película en un estudio de doblaje

Te toca experimentar

La mejor forma de juzgar un modelo de voz es darle tu guion y escucharlo. No necesitas un estudio, una partida presupuestaria ni una semana de preparación para empezar.

Aquí tienes un plan para una tarde:

  • Escribe un guion de 150 palabras con un giro emocional en el medio.
  • Renderiza el guion en ElevenLabs v3 con tres voces distintas y un cambio en el control deslizante de estilo.
  • Añade una base musical de ElevenLabs Music.
  • Transcribe el resultado con GPT-4o Transcribe y compara las palabras con tu guion.

Cuando v4 llegue a la plataforma que elijas, ya sabrás qué etiquetas, voces y ajustes encajan con tu material, y podrás presupuestar con los precios de lista con confianza.

Abre Picasso IA y prueba tu primer guion hoy. Elige una voz, añade una etiqueta apilada y escucha la diferencia que marca la dirección.

Dos amigos riendo mientras graban un podcast en una mesa redonda de madera

Compartir este artículo

Elige tu idioma