Precios de la API TTS de OpenAI: voces, tts-1-hd y comparación con ElevenLabs
OpenAI cobra $15 por millón de caracteres en tts-1, $30 en tts-1-hd y unos $0,015 por minuto en gpt-4o-mini-tts. Este desglose enumera todas las voces, calcula el costo real de un artículo y de un audiolibro, y compara las cifras con ElevenLabs.
La API de texto a voz de OpenAI es una de las formas más baratas de poner una voz en una app, un curso o un podcast, y la lista de precios cabe en una frase: $15 por millón de caracteres para tts-1, $30 por millón para tts-1-hd, y unos $0,015 por minuto de audio para el más reciente gpt-4o-mini-tts. ElevenLabs cobra $0,10 por cada 1.000 caracteres en sus modelos más avanzados, más de tres veces la tarifa de tts-1-hd. Que esa diferencia merezca la pena depende de las voces, los idiomas y de lo humana que deba sonar la locución. Esta página detalla cada tarifa de OpenAI, enumera las voces modelo por modelo, calcula ejemplos de costo real y pone las cifras junto a ElevenLabs para que elijas antes de escribir una línea de código.
💡 Cálculo rápido: un minuto de narración son unos 900 caracteres. Eso cuesta unos $0,014 en tts-1, $0,027 en tts-1-hd y $0,09 en ElevenLabs v3 o Multilingual v2.
Lo que cobra OpenAI por carácter
OpenAI factura sus dos modelos de voz clásicos por caracteres de entrada, no por segundos de audio. Pagas por el texto que envías, así que una lectura lenta y dramática cuesta lo mismo que una rápida. La página del modelo tts-1-hd indica que el endpoint de voz (v1/audio/speech) es su única ruta compatible, y ese mismo endpoint sirve a tts-1 y a gpt-4o-mini-tts.
Tarifas de tts-1 y tts-1-hd
La lista de precios pública es breve. No hay cuota fija ni gasto mínimo: añades crédito a tu cuenta y cada solicitud lo descuenta.
Modelo
Precio
Por 1.000 caracteres
Ideal para
tts-1
$15 por 1M de caracteres
$0,015
Apps y asistentes de baja latencia
tts-1-hd
$30 por 1M de caracteres
$0,030
Audio terminado que se reproduce varias veces
gpt-4o-mini-tts
$0,60 por 1M de tokens de texto más $12 por 1M de tokens de audio
Basado en tokens, unos $0,015 por minuto
Entrega expresiva y ajustable
El modelo HD cuesta exactamente el doble. Para un guion típico sigue siendo poco dinero, por eso la decisión real rara vez depende del dinero. La página del modelo tts-1-hd indica límites de solicitudes de entre 2.500 y 10.000 por minuto según tu nivel de uso, muy por encima de lo que envían la mayoría de las apps.
gpt-4o-mini-tts factura por token
El modelo más nuevo rompe el patrón por carácter. Cobra $0,60 por millón de tokens de texto de entrada y $12 por millón de tokens de audio de salida, lo que equivale a unos $0,015 por minuto de audio generado. Queda casi igual que tts-1, pero añade un campo instructions en el que describes la entrega con lenguaje natural, como "habla despacio, como un profesor paciente". Los modelos tts-1 no tienen ese control.
Una llamada mínima con el SDK oficial de Python tiene este aspecto:
from openai import OpenAI
client = OpenAI()
with client.audio.speech.with_streaming_response.create(
model="tts-1-hd",
voice="coral",
input="Your order shipped this morning and should arrive on Friday.",
response_format="mp3",
) as response:
response.stream_to_file("order-update.mp3")
Cambia el nombre del modelo a gpt-4o-mini-tts y añade una cadena instructions para dirigir la entrega. Cada solicitud admite hasta 4.096 caracteres de entrada, así que los guiones largos deben dividirse en fragmentos y unirse después.
Las voces que realmente obtienes
El número de voces es donde más difieren los tres modelos de OpenAI, y importa más de lo que admiten muchas páginas de precios. Un modelo barato con una sola voz que no te gusta no es barato.
Nueve voces en tts-1 y tts-1-hd
Los dos modelos clásicos comparten las mismas nueve voces: alloy, ash, coral, echo, fable, onyx, nova, sage y shimmer. Es suficiente variedad para un narrador, un asistente amable y un locutor más grave, pero no para un reparto de personajes distintos.
Cuatro voces extra en el modelo más nuevo
gpt-4o-mini-tts ofrece 13 voces. Mantiene las nueve originales y añade ballad, verse, marin y cedar. OpenAI recomienda marin o cedar si quieres la mejor calidad.
Hay algunos detalles prácticos que se aplican a los tres:
Formatos de salida: MP3 por defecto, además de Opus, AAC, FLAC, WAV y PCM. WAV y PCM devuelven el audio antes.
Streaming: la API admite streaming por fragmentos, así que la reproducción puede empezar antes de que se genere el archivo completo.
Idiomas: unos 99, siguiendo el soporte de idiomas de Whisper. OpenAI señala que las voces están optimizadas para inglés, así que prueba tu idioma de destino antes de comprometerte.
Aviso: las políticas de uso exigen avisar claramente a los usuarios finales de que la voz es generada por IA y no es humana.
¿tts-1 o tts-1-hd?
Ambos modelos aceptan las mismas nueve voces y la misma entrada, así que cambiar de uno a otro supone modificar una sola palabra en tu código. Eso facilita probarlos: genera un párrafo con cada uno y escúchalos en el dispositivo que usa tu público.
Lo que aportan los $15 extra
OpenAI presenta tts-1 como la opción de menor latencia y tts-1-hd como la de mayor calidad. En pasajes largos, espera una entrega más suave y estable del modelo HD, y ten en cuenta que la diferencia se nota más con auriculares. En el altavoz de un teléfono dentro de una app con ruido, muchos oyentes no la notarán.
Cómo elegir entre ellos
Elige tts-1 para respuestas de chat, asistentes de voz, notificaciones y cualquier caso en el que el primer sonido deba llegar rápido.
Elige tts-1-hd para audiolibros, lecciones de cursos, podcasts y anuncios, audio que la gente reproduce varias veces y juzga con atención.
Elige gpt-4o-mini-tts cuando la voz necesite un tono: un agente de soporte tranquilo, un locutor de producto entusiasta, un susurro.
💡 Regla general: en contenido terminado, la cuenta es sencilla. Renderizar un audiolibro de 80.000 palabras en HD en lugar de en estándar añade unos $7,20 a la factura, así que elige HD por defecto siempre que los oyentes vayan a escuchar el audio más de una vez.
Ejemplos de costo real
Todas las cifras siguientes suponen un ritmo de narración de 150 palabras por minuto y unos 6 caracteres por palabra con espacios incluidos, lo que equivale a 900 caracteres por minuto. Tus guiones serán distintos, así que trata estas cifras como estimaciones de presupuesto, no como facturas.
Trabajo
tts-1
tts-1-hd
gpt-4o-mini-tts
ElevenLabs Flash
ElevenLabs v3 o Multilingual v2
Artículo de 1.000 palabras (6.000 caracteres)
$0,09
$0,18
unos $0,10
$0,30
$0,60
Audiolibro de 80.000 palabras (480.000 caracteres)
$7,20
$14,40
unos $8,00
$24,00
$48,00
1 millón de caracteres al mes
$15
$30
unos $16,70
$50
$100
Un artículo de 1.000 palabras
Convertir una entrada de blog en una versión para escuchar cuesta menos de diez centavos en tts-1 y menos de veinticinco en HD. Incluso con la tarifa más alta de ElevenLabs son 60 centavos, así que para narraciones ocasionales la diferencia de precio casi no importa. Elige por el sonido, no por el costo.
Un audiolibro de 80.000 palabras
Un libro completo es donde la diferencia se hace visible: $14,40 en tts-1-hd frente a $48 en los modelos más avanzados de ElevenLabs, por unas nueve horas de audio. Un narrador humano cuesta mucho más por hora terminada que cualquier columna de esa tabla, así que cada opción aquí es una fracción del precio de reservar un estudio.
Un millón de caracteres al mes
A escala de app, los niveles se separan. Un producto que convierte en voz un millón de caracteres al mes paga entre $15 y $100 según el proveedor y el modelo. Ojo con los reintentos: si regeneras cada tercer clip, suma un tercio a todas las cifras. Guarda en caché el audio de frases repetidas, como saludos y mensajes de error, porque el mismo texto nunca necesita pagarse dos veces.
TTS de OpenAI frente a ElevenLabs
La tabla de costos muestra quién es más barato. No muestra quién suena mejor para tu caso de uso, ni qué pasa cuando tu guion es más largo de lo que admite una sola solicitud.
Factor
OpenAI tts-1-hd
ElevenLabs Flash v2.5
ElevenLabs Multilingual v2 y v3
Precio de la API por 1.000 caracteres
$0,030
$0,05
$0,10
Idiomas
Unos 99
32
29 (v2), más de 70 (v3)
Máximo de caracteres por solicitud
4.096
40.000
10.000 (v2), 5.000 (v3)
Voces integradas
9
Biblioteca amplia más clonación de voz
Biblioteca amplia más clonación de voz
Enfoque en velocidad
Menor latencia en tts-1
Unos 75 ms según el proveedor
Mayor calidad, más lento
Las cifras de ElevenLabs proceden de desgloses de precios de mediados de 2026. La empresa actualiza sus planes con frecuencia, así que confirma las cifras vigentes en su página de precios antes de fijar un presupuesto.
Precio por 1.000 caracteres
En la API, tts-1 está en $0,015, tts-1-hd en $0,030, ElevenLabs Flash y Turbo en $0,05, y Multilingual v2 y v3 en $0,10. Eso hace que ElevenLabs Flash cueste unas 1,7 veces más que tts-1-hd, y sus modelos más avanzados unas 3,3 veces más. En cambio, las suscripciones incluyen créditos: el plan gratuito incluye 10.000 créditos al mes, con un crédito por carácter en los modelos estándar y medio crédito en Flash y Turbo.
Calidad de voz y expresión
El precio es solo la mitad de la historia. ElevenLabs construyó su reputación con una entrega expresiva y natural, y Eleven v3 añade rango emocional y diálogos con varios hablantes en más de 70 idiomas. La respuesta de OpenAI es la capacidad de ajuste: gpt-4o-mini-tts acepta instrucciones en lenguaje natural sobre acento, tono, velocidad y emoción, algo que ninguno de los dos modelos tts-1 puede hacer.
Si necesitas un reparto de personajes que suenen distintos en cada escena, la biblioteca de voces y la clonación de ElevenLabs te dan más margen. Si necesitas una sola voz fiable y barata, OpenAI gana en costo. La única prueba honesta es pasar el mismo párrafo por ambos y escucharlo.
Límites, idiomas y licencias
Los límites de solicitud condicionan tu código. OpenAI limita la entrada a 4.096 caracteres y Eleven v3 a 5.000, así que un guion largo necesita fragmentación y una forma de mantener la voz coherente entre partes. Flash v2.5 admite 40.000 caracteres, lo que significa menos uniones en lecturas largas.
Las licencias también difieren. El plan gratuito de ElevenLabs no tiene licencia comercial, y los derechos comerciales empiezan con el primer plan de pago. OpenAI exige avisar a los usuarios finales de que la voz es generada por IA. Lee ambos conjuntos de condiciones antes de enviar audio a tus clientes.
Cómo usar ElevenLabs v3 en PicassoIA
Antes de pagar por carácter, puedes escuchar el lado de ElevenLabs de esta comparación en el navegador. La colección de texto a voz de PicassoIA incluye 24 modelos, entre ellos ElevenLabs v3, Flash v2.5, Turbo v2.5 y Multilingual v2, además de opciones de MiniMax, Google, Inworld y Resemble AI. Pega un guion, elige una voz y el audio está listo en segundos.
Pasos en el navegador
Abre la página de ElevenLabs v3 en la colección de texto a voz.
Pega tu guion en el campo Prompt.
Elige una voz en el desplegable. La predeterminada es Rachel, y la lista tiene más de 25 perfiles de voz.
Define el código de idioma. El predeterminado es en; usa es u fr para español o francés.
Deja la estabilidad en 0,5, el refuerzo de similitud en 0,75, el estilo en 0 y la velocidad en 1 para la primera prueba.
Ejecuta el modelo, escucha, ajusta un parámetro cada vez y descarga el archivo que más te guste.
Ajustes que cambian el resultado
Estabilidad: los valores altos mantienen la voz constante a lo largo de un guion largo; los bajos permiten más variación.
Estilo: un control deslizante de 0 a 1 que pasa de una narración neutra a una lectura más teatral.
Velocidad: de 0,25x a 4x, útil para ralentizar la narración de tutoriales.
Texto anterior y posterior: pega las frases antes y después de un fragmento para que la entonación siga natural en la unión. Es la solución a los límites de caracteres por solicitud mencionados antes.
Para una prueba A/B rápida, pasa el mismo párrafo por Flash v2.5 por su velocidad, MiniMax Speech 2.8 HD para una calidad de estudio, Gemini 3.1 Flash TTS por sus 30 voces y más de 70 idiomas, y Inworld TTS 1.5 Max para locuciones multilingües rápidas. Después compara los resultados con una muestra de tts-1-hd de tu propia cuenta.
También música y transcripción
La voz rara vez es el único trabajo de audio. Un video de producto necesita una base musical, y un podcast necesita una transcripción para subtítulos y búsqueda.
Transcribe audio. Para convertir una narración terminada o una entrevista en texto, usa GPT-4o Transcribe, GPT-4o Mini Transcribe o Gemini 3 Pro. Una transcripción sirve como subtítulos, notas de programa y revisión ortográfica: si la transcripción malinterpreta una palabra, es probable que el oyente también la malinterprete.
Un flujo sencillo une todo: escribe el guion, renderiza la voz, añade una base musical y transcribe la mezcla final para revisar la redacción.
Pruébalo tú mismo hoy
Las tablas de precios solo llegan hasta cierto punto. La forma más rápida de decidir entre OpenAI y ElevenLabs es escuchar tu propio guion en varias voces y ver cuánto cuesta cada opción con tu volumen. Abre PicassoIA, pega un párrafo en un modelo de texto a voz y compáralo con un clip de tts-1-hd. Luego añade una pista musical, transcribe el resultado y genera unas cuantas imágenes fotorrealistas para la portada de tu episodio o video. Todo lo necesario para probar un flujo de trabajo completo de audio y visual está en un solo lugar, así que experimenta con libertad y quédate con la combinación que mejor suene.