Voces de OpenAI TTS: muestras, opciones y cuál elegir

Trece voces de OpenAI TTS, tres modelos y ninguna vista previa de audio. Este artículo compara cada voz, indica qué modelo la admite, ofrece un guion de prueba para escucharlas tú mismo, desglosa los costos reales y recomienda opciones iniciales para narración, bots de soporte y video corto.

Voces de OpenAI TTS: muestras, opciones y cuál elegir
Cristian Da Conceicao
Fundador de Picasso IA

Trece nombres de voz, tres modelos y ninguna vista previa de audio en la página donde tienes que elegir. Es el primer obstáculo con el que tropiezan la mayoría de los desarrolladores con el endpoint de voz de OpenAI. Alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin y cedar parecen igual de razonables en un menú desplegable, pero no se comportan igual en todos los modelos y no sonarán igual con tu guion. Este artículo explica qué es cada una de las voces de OpenAI TTS, qué modelo la admite, cómo probar las trece en menos de diez minutos, cuánto supone la factura y con qué voz conviene empezar para narración, bots de soporte y video corto. También menciona las herramientas de voz de PicassoIA que complementan la oferta de OpenAI, incluida una con un tutorial que puedes ejecutar hoy mismo.

Qué ofrece realmente OpenAI TTS

La API de texto a voz de OpenAI convierte texto escrito en audio hablado a través de un único endpoint. Envías el nombre de un modelo, el nombre de una voz y tu texto, y recibes un archivo de audio. Lo que más confunde es que el modelo que elijas decide cuántas voces puedes usar y cuánto control tienes sobre la entrega.

Tres modelos, tres precios

ModeloVocesPrecioIdeal para
tts-19$15 por 1M de caracteresBorradores rápidos y económicos y reproducción en directo
tts-1-hd9$30 por 1M de caracteresAudio de mayor fidelidad renderizado con antelación
gpt-4o-mini-tts13$0.60 por 1M de tokens de texto de entrada, $12 por 1M de tokens de audio de salidaTono, ritmo y acento ajustables mediante instrucciones

Los dos modelos anteriores se cobran por número de caracteres. gpt-4o-mini-tts se cobra por tokens, lo que significa que tu costo depende de la duración del audio y no de la longitud del guion.

Primer plano de la rejilla de un micrófono de estudio plateado sobre una mesa de madera

Formatos de salida y streaming

El audio se devuelve por defecto en MP3, con Opus, AAC, FLAC, WAV y PCM como alternativas. Cada uno tiene su función:

  • MP3 es la opción predeterminada segura para sitios web y podcasts.
  • Opus es ideal para streaming por internet porque ocupa poco espacio.
  • AAC se reproduce bien en teléfonos y en editores de video.
  • FLAC conserva todo, lo que importa si piensas editar el archivo después.
  • WAV y PCM no están comprimidos, así que son la elección cuando la latencia pesa más que el tamaño del archivo.

El endpoint puede transmitir el audio a medida que se genera, de modo que la reproducción puede empezar antes de que termine todo el clip. Eso marca una diferencia real en los asistentes de voz, donde una pausa de dos segundos parece una llamada cortada.

Las 13 voces de un vistazo

Vista desde arriba de un escritorio con trece tazas pequeñas, auriculares y una libreta

Nueve voces funcionan en todos los modelos. Otras cuatro solo funcionan en gpt-4o-mini-tts. Esta es la lista completa, con una nota sobre cómo suelen describirla quienes las escuchan.

💡 Lee esto primero: OpenAI no publica etiquetas de personalidad para sus voces, así que la columna "suele describirse como" refleja lo que dicen los desarrolladores y los oyentes, no una especificación oficial. Tómala como una lista corta y deja que tus propios oídos decidan.

Las nueve originales

VozSuele describirse comoFunciona en
alloyNeutral, equilibrada, de uso generalLos tres modelos
ashMás suave, ligeramente rasposa, conversacionalLos tres modelos
coralCálida, amigable, cercanaLos tres modelos
echoClara, estable, directaLos tres modelos
fableEstilo narrador, expresiva, a menudo percibida como británicaLos tres modelos
novaBrillante, enérgica, animadaLos tres modelos
onyxGrave, autoritaria, tranquilaLos tres modelos
sageMedida, reflexiva, de ritmo uniformeLos tres modelos
shimmerLigera, clara, suaveLos tres modelos

Estas nueve llevan más tiempo disponibles, así que son las más usadas y las que más opiniones tienen. Si tu producto ya usa alloy o nova, rara vez hay motivo para cambiar, salvo que las voces nuevas resuelvan un problema concreto.

Las cuatro voces nuevas

VozSuele describirse comoFunciona en
balladSuave, melódica, delicadaSolo gpt-4o-mini-tts
verseExpresiva, dinámica, animadaSolo gpt-4o-mini-tts
marinNatural, pulida, calidad de primera líneaSolo gpt-4o-mini-tts
cedarNatural, con los pies en la tierra, cálidaSolo gpt-4o-mini-tts

La documentación de OpenAI recomienda marin o cedar para la mejor calidad, lo que las convierte en la primera prueba natural para cualquier proyecto nuevo. Como solo funcionan en gpt-4o-mini-tts, elegirlas también significa que tienes el campo de instrucciones, que es donde está la flexibilidad real.

Probar voces y ajustar la entrega

Una mujer con auriculares compara archivos de audio en un equipo portátil, con un guion impreso a su lado

El audio no cabe en una página de texto, así que la forma más rápida de obtener muestras reales es generarlas tú mismo. Trece clips del mismo guion llevan unos minutos y cuestan unos centavos.

Un guion que deja al descubierto las voces débiles

Un buen guion de prueba no es un párrafo bonito. Es una prueba de esfuerzo. Usa algo como esto:

Pedido de 4.817 envíos el 3 de marzo para la Dra. Okonkwo en 22 Birchwood Lane. Espera, ¿dijiste jueves? Sinceramente, no esperaba que la entrega llegara antes, pero aquí estamos. Tres cosas que recordar: trae el recibo, revisa el sello y llámanos si algo te parece raro.

Reúne un número largo, una fecha, un apellido difícil, una pregunta, un momento emocional leve y una lista. Las voces que suenan genial en una sola frase suelen tropezar con alguno de esos elementos. Luego ejecuta este bucle:

from openai import OpenAI
from pathlib import Path

client = OpenAI()
script = "Order 4,817 ships on March 3rd to Dr. Okonkwo at 22 Birchwood Lane. ..."
voices = ["alloy", "ash", "ballad", "coral", "echo", "fable", "nova",
          "onyx", "sage", "shimmer", "verse", "marin", "cedar"]

for voice in voices:
    out = Path(f"sample_{voice}.mp3")
    with client.audio.speech.with_streaming_response.create(
        model="gpt-4o-mini-tts",
        voice=voice,
        input=script,
        instructions="Speak clearly in a warm, even tone.",
    ) as response:
        response.stream_to_file(out)

Escucha con buenos auriculares y puntúa cada clip en cuatro aspectos:

  1. Números y nombres: ¿"4.817" suena como una sola frase natural?
  2. La pregunta: ¿sube el tono en "¿dijiste jueves?"?
  3. Ritmo: ¿las comas suenan a respiraciones o a paradas?
  4. Cansancio: ¿aguantarías esta voz durante diez minutos seguidos?

Instrucciones que cambian la lectura

En gpt-4o-mini-tts, un campo de instrucciones te permite describir en lenguaje natural cómo debe sonar la voz. OpenAI indica que el modelo puede recibir indicaciones sobre acento, rango emocional, entonación, imitaciones, velocidad, tono y susurros. Los modelos anteriores tts-1 y tts-1-hd no lo admiten.

InstrucciónQué esperar
"Habla con un tono alegre y positivo."Una lectura animada y amable, buena para la bienvenida a un producto
"Tranquila, lenta, como un cuento para dormir."Una entrega más suave con pausas más largas
"Profesional y concisa, como un presentador de noticias."Ritmo más ajustado, emoción más plana
"Susurra la última frase."Un final en voz baja para dar dramatismo
"Suena como si pidiera disculpas, pero con seguridad."Útil para guiones de soporte sobre retrasos

💡 Consejo: Mantén las instrucciones cortas y concretas. Una frase clara suele ganar a un párrafo de adjetivos, y cambiar una sola instrucción cada vez deja claro qué movió el resultado.

Qué voz encaja con cada trabajo

La tabla siguiente es un conjunto de puntos de partida para probar, no reglas. Las voces son subjetivas, y tu guion importa más que cualquier etiqueta.

TrabajoPrimera opciónAlternativa
Audiolibros y lecturas largascedarsage
Soporte y bots telefónicosmarincoral
Demos de productoalloyecho
Anuncios y clips cortosnovaverse
Meditación y contenido relajanteballadshimmer

Narración y lecturas largas

Un hombre mayor escucha un audiolibro sentado en un sillón junto a una lámpara

Escuchar durante mucho tiempo castiga a las voces con una personalidad marcada. Una voz brillante que te encanta durante quince segundos puede agotarte al minuto diez. Para la narración, elige algo uniforme y sin prisas, y usa las instrucciones para añadir calidez. Divide el manuscrito en los saltos de párrafo, porque cada solicitud tiene un límite de longitud de entrada y los fragmentos más cortos le dan a la voz un nuevo comienzo. Consulta la referencia actual de la API para ver el límite exacto.

Asistentes y bots de soporte

Un agente de soporte con diadema habla frente a una configuración de dos monitores en una oficina luminosa

En un bot, los rasgos que marcan la diferencia son la claridad y un tono creíble bajo una leve presión. Prueba tu voz con los peores mensajes que envías: reembolsos, retrasos, interrupciones del servicio. Una voz que suena alegre al dar malas noticias resulta insensible, así que incluye instrucciones como "tranquila y sincera" en cada solicitud. Combínalo con streaming para que las respuestas empiecen rápido.

Anuncios y clips cortos

Un joven graba un video vertical en una cocina con un teléfono sobre un trípode

Los clips cortos premian la energía. Apóyate en nova o verse, añade una instrucción como "animada, rápida, conversacional" y usa frases cortas para que la entrega nunca tenga que apresurarse. Renderiza dos o tres versiones y elige por oído, ya que la diferencia entre una buena toma y una excelente suele ser un solo adjetivo cambiado.

Costos y límites en cifras reales

Vista desde arriba de un libro de contabilidad, una calculadora y facturas sobre un escritorio de madera

Por carácter frente a por token

Un manuscrito de 10.000 palabras tiene aproximadamente 60.000 caracteres y unos 67 minutos de habla a un ritmo natural. Para gpt-4o-mini-tts, la estimación de lanzamiento de OpenAI era de alrededor de 1,5 centavos por minuto de audio, que es como se calcula la última fila de la tabla siguiente.

ModeloCosto aproximado para 10.000 palabras
tts-1Unos $0.90
tts-1-hdUnos $1.80
gpt-4o-mini-ttsUnos $1.00

Estas cifras son lo bastante pequeñas como para que la calidad de voz decida el modelo, no el precio. El costo mayor es tu tiempo volviendo a renderizar tomas que fallaron el tono, y ese es otro argumento a favor del campo de instrucciones.

Soporte de idiomas

OpenAI indica compatibilidad con más de 50 idiomas, desde afrikáans y árabe hasta checo, danés y neerlandés, con la nota de que las voces están optimizadas actualmente para inglés. En la práctica, un guion en otro idioma funciona, pero el acento puede desviarse hacia la fonética inglesa. Prueba cada idioma que publiques y pide a un hablante nativo que lo escuche antes del lanzamiento.

Divulgación y voces personalizadas

Las políticas de uso de OpenAI exigen informar con claridad a los usuarios finales de que la voz que escuchan está generada por IA y no es una persona. Incluye ese aviso en tu producto, no en la letra pequeña. Existen voces personalizadas, pero requieren un proceso aparte que exige grabaciones de consentimiento del locutor y muestras de audio, así que prevé el tiempo de espera necesario si quieres una voz de marca.

Alternativas en PicassoIA

PicassoIA no ofrece los modelos de voz de OpenAI. Lo que sí ofrece es un amplio conjunto de otros motores en la categoría Generate speech, además de herramientas para los dos trabajos que rodean al trabajo con voz: revisar el resultado y añadir sonido por debajo.

Otros motores de voz

ModeloRasgo destacado
Gemini 3.1 Flash TTS30 voces, más de 70 códigos de idioma, prompts de estilo y etiquetas expresivas
MiniMax Speech 2.8 HDLocuciones de calidad de estudio
ElevenLabs V3Locuciones con IA naturales y expresivas
Inworld TTS 1.5 MaxLocuciones rápidas en 15 idiomas
ChatterboxClonación de voz con control de emoción
Qwen3 TTSClona una voz o diseña la tuya

Revisar la salida con transcripción

Una forma rápida de detectar nombres mal pronunciados es pasar el audio generado por un reconocimiento de voz a texto y compararlo con tu guion. GPT-4o Transcribe y GPT-4o Mini Transcribe sirven para esto, y Gemini 3 Pro es una buena tercera opinión. Si la transcripción omite o cambia una palabra, es probable que un oyente haya escuchado lo mismo.

Añade música debajo de la voz

Un productor musical ajusta un fader en una gran consola de mezcla en un estudio casero con poca luz

Una locución sin música de fondo puede resultar vacía. Genera una pista en la categoría Generate music y mézclala con un volumen bajo detrás de la narración. ElevenLabs Music, MiniMax Music 2.6, Lyria 3 Pro y Stable Audio 2.5 convierten un prompt de texto en una pista. Pide algo como «instrumental suave, sin voces, tempo estable» para que nada compita con las palabras.

Usa Gemini 3.1 Flash TTS en PicassoIA

Un equipo portátil, un pequeño micrófono de condensador y una libreta con una lista de voces escrita a mano sobre un escritorio luminoso

Como las voces de OpenAI no están alojadas allí, la alternativa más parecida es Gemini 3.1 Flash TTS, que ofrece un flujo de trabajo similar con una lista de voces más amplia. Así se usa:

  1. Abre la página del modelo y localiza el formulario de entrada.
  2. Pega tu guion en el campo Text. El límite es de 4.000 bytes, así que divide los guiones más largos.
  3. Elige una voz entre las 30 opciones. La predeterminada es Kore, y nombres como Puck, Charon, Fenrir, Aoede y Zephyr son buenos puntos de partida.
  4. Escribe un prompt de estilo en el campo Prompt. El predeterminado es "Say the following." Sustitúyelo por algo como "Habla despacio y con seguridad" o "Usa un tono tranquilo y amigable".
  5. Configura el código de idioma. El predeterminado es en-US, y hay más de 70 códigos disponibles.
  6. Genera, escucha y ajusta. Cambia una sola cosa por ejecución para saber qué causó la diferencia.
AjusteConsejo
Etiquetas de textoAñade [whispering], [laughing], [shouting], [sigh] o [extremely fast] justo antes de la frase que deben afectar
PromptDescribe el ritmo, el tono y el acento en una sola frase
VozPrueba tres voces con el mismo párrafo antes de decidirte
Código de idiomaAjústalo al idioma del guion, no al tuyo

💡 Consejo: Pasa el clip final por GPT-4o Transcribe para confirmar que todos los nombres y números salieron como están escritos.

Pruébalo tú mismo en Picasso IA

Elegir entre las voces de OpenAI TTS es una tarea de escucha, y la forma más rápida de mejorar en ella es generar clips y compararlos. Toma el guion de prueba de arriba, ejecútalo con las trece voces y luego pasa el mismo guion por Gemini 3.1 Flash TTS y MiniMax Speech 2.8 HD en Picasso IA. Añade una base musical suave, revisa la transcripción y quédate con la voz que siga sonando bien a la décima escucha. Abre Picasso IA, pega tu propio guion y empieza con una voz y una instrucción. Tu primera locución utilizable está más cerca de lo que parece en el menú desplegable.

Compartir este artículo

Elige tu idioma