Precios de la API TTS de OpenAI: voces, tts-1-hd y comparación con ElevenLabs

OpenAI cobra $15 por millón de caracteres en tts-1, $30 en tts-1-hd y unos $0,015 por minuto en gpt-4o-mini-tts. Este desglose enumera todas las voces, calcula el costo real de un artículo y de un audiolibro, y compara las cifras con ElevenLabs.

Precios de la API TTS de OpenAI: voces, tts-1-hd y comparación con ElevenLabs
Cristian Da Conceicao
Fundador de Picasso IA

La API de texto a voz de OpenAI es una de las formas más baratas de poner una voz en una app, un curso o un podcast, y la lista de precios cabe en una frase: $15 por millón de caracteres para tts-1, $30 por millón para tts-1-hd, y unos $0,015 por minuto de audio para el más reciente gpt-4o-mini-tts. ElevenLabs cobra $0,10 por cada 1.000 caracteres en sus modelos más avanzados, más de tres veces la tarifa de tts-1-hd. Que esa diferencia merezca la pena depende de las voces, los idiomas y de lo humana que deba sonar la locución. Esta página detalla cada tarifa de OpenAI, enumera las voces modelo por modelo, calcula ejemplos de costo real y pone las cifras junto a ElevenLabs para que elijas antes de escribir una línea de código.

💡 Cálculo rápido: un minuto de narración son unos 900 caracteres. Eso cuesta unos $0,014 en tts-1, $0,027 en tts-1-hd y $0,09 en ElevenLabs v3 o Multilingual v2.

Lo que cobra OpenAI por carácter

OpenAI factura sus dos modelos de voz clásicos por caracteres de entrada, no por segundos de audio. Pagas por el texto que envías, así que una lectura lenta y dramática cuesta lo mismo que una rápida. La página del modelo tts-1-hd indica que el endpoint de voz (v1/audio/speech) es su única ruta compatible, y ese mismo endpoint sirve a tts-1 y a gpt-4o-mini-tts.

Tarifas de tts-1 y tts-1-hd

La lista de precios pública es breve. No hay cuota fija ni gasto mínimo: añades crédito a tu cuenta y cada solicitud lo descuenta.

ModeloPrecioPor 1.000 caracteresIdeal para
tts-1$15 por 1M de caracteres$0,015Apps y asistentes de baja latencia
tts-1-hd$30 por 1M de caracteres$0,030Audio terminado que se reproduce varias veces
gpt-4o-mini-tts$0,60 por 1M de tokens de texto más $12 por 1M de tokens de audioBasado en tokens, unos $0,015 por minutoEntrega expresiva y ajustable

Vista cenital de un escritorio de nogal con una calculadora, una factura en blanco, monedas y un micrófono de condensador, usado para presupuestar costos de texto a voz

El modelo HD cuesta exactamente el doble. Para un guion típico sigue siendo poco dinero, por eso la decisión real rara vez depende del dinero. La página del modelo tts-1-hd indica límites de solicitudes de entre 2.500 y 10.000 por minuto según tu nivel de uso, muy por encima de lo que envían la mayoría de las apps.

gpt-4o-mini-tts factura por token

El modelo más nuevo rompe el patrón por carácter. Cobra $0,60 por millón de tokens de texto de entrada y $12 por millón de tokens de audio de salida, lo que equivale a unos $0,015 por minuto de audio generado. Queda casi igual que tts-1, pero añade un campo instructions en el que describes la entrega con lenguaje natural, como "habla despacio, como un profesor paciente". Los modelos tts-1 no tienen ese control.

Desarrollador de software de pie en un escritorio con dos monitores que muestran editores de código desenfocados, integrando una API de texto a voz en una app

Una llamada mínima con el SDK oficial de Python tiene este aspecto:

from openai import OpenAI

client = OpenAI()

with client.audio.speech.with_streaming_response.create(
    model="tts-1-hd",
    voice="coral",
    input="Your order shipped this morning and should arrive on Friday.",
    response_format="mp3",
) as response:
    response.stream_to_file("order-update.mp3")

Cambia el nombre del modelo a gpt-4o-mini-tts y añade una cadena instructions para dirigir la entrega. Cada solicitud admite hasta 4.096 caracteres de entrada, así que los guiones largos deben dividirse en fragmentos y unirse después.

Las voces que realmente obtienes

El número de voces es donde más difieren los tres modelos de OpenAI, y importa más de lo que admiten muchas páginas de precios. Un modelo barato con una sola voz que no te gusta no es barato.

Vista desde abajo de una presentadora de podcast con chaqueta de pana hablando frente a un micrófono de radiodifusión en un estudio con luz cálida

Nueve voces en tts-1 y tts-1-hd

Los dos modelos clásicos comparten las mismas nueve voces: alloy, ash, coral, echo, fable, onyx, nova, sage y shimmer. Es suficiente variedad para un narrador, un asistente amable y un locutor más grave, pero no para un reparto de personajes distintos.

Cuatro voces extra en el modelo más nuevo

gpt-4o-mini-tts ofrece 13 voces. Mantiene las nueve originales y añade ballad, verse, marin y cedar. OpenAI recomienda marin o cedar si quieres la mejor calidad.

ModeloVocesNombres
tts-19alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer
tts-1-hd9Las mismas nueve
gpt-4o-mini-tts13Las nueve más ballad, verse, marin, cedar

Hay algunos detalles prácticos que se aplican a los tres:

  • Formatos de salida: MP3 por defecto, además de Opus, AAC, FLAC, WAV y PCM. WAV y PCM devuelven el audio antes.
  • Streaming: la API admite streaming por fragmentos, así que la reproducción puede empezar antes de que se genere el archivo completo.
  • Idiomas: unos 99, siguiendo el soporte de idiomas de Whisper. OpenAI señala que las voces están optimizadas para inglés, así que prueba tu idioma de destino antes de comprometerte.
  • Aviso: las políticas de uso exigen avisar claramente a los usuarios finales de que la voz es generada por IA y no es humana.

¿tts-1 o tts-1-hd?

Ambos modelos aceptan las mismas nueve voces y la misma entrada, así que cambiar de uno a otro supone modificar una sola palabra en tu código. Eso facilita probarlos: genera un párrafo con cada uno y escúchalos en el dispositivo que usa tu público.

Primer plano extremo de unos auriculares de estudio con almohadillas de cuero apoyados sobre una mesa de madera con luz de la mañana

Lo que aportan los $15 extra

OpenAI presenta tts-1 como la opción de menor latencia y tts-1-hd como la de mayor calidad. En pasajes largos, espera una entrega más suave y estable del modelo HD, y ten en cuenta que la diferencia se nota más con auriculares. En el altavoz de un teléfono dentro de una app con ruido, muchos oyentes no la notarán.

Cómo elegir entre ellos

  • Elige tts-1 para respuestas de chat, asistentes de voz, notificaciones y cualquier caso en el que el primer sonido deba llegar rápido.
  • Elige tts-1-hd para audiolibros, lecciones de cursos, podcasts y anuncios, audio que la gente reproduce varias veces y juzga con atención.
  • Elige gpt-4o-mini-tts cuando la voz necesite un tono: un agente de soporte tranquilo, un locutor de producto entusiasta, un susurro.

💡 Regla general: en contenido terminado, la cuenta es sencilla. Renderizar un audiolibro de 80.000 palabras en HD en lugar de en estándar añade unos $7,20 a la factura, así que elige HD por defecto siempre que los oyentes vayan a escuchar el audio más de una vez.

Ejemplos de costo real

Todas las cifras siguientes suponen un ritmo de narración de 150 palabras por minuto y unos 6 caracteres por palabra con espacios incluidos, lo que equivale a 900 caracteres por minuto. Tus guiones serán distintos, así que trata estas cifras como estimaciones de presupuesto, no como facturas.

Trabajotts-1tts-1-hdgpt-4o-mini-ttsElevenLabs FlashElevenLabs v3 o Multilingual v2
Artículo de 1.000 palabras (6.000 caracteres)$0,09$0,18unos $0,10$0,30$0,60
Audiolibro de 80.000 palabras (480.000 caracteres)$7,20$14,40unos $8,00$24,00$48,00
1 millón de caracteres al mes$15$30unos $16,70$50$100

Narrador de audiolibros leyendo un manuscrito grueso dentro de una cabina de voz revestida de espuma, visto a través del cristal de la sala de control

Un artículo de 1.000 palabras

Convertir una entrada de blog en una versión para escuchar cuesta menos de diez centavos en tts-1 y menos de veinticinco en HD. Incluso con la tarifa más alta de ElevenLabs son 60 centavos, así que para narraciones ocasionales la diferencia de precio casi no importa. Elige por el sonido, no por el costo.

Un audiolibro de 80.000 palabras

Un libro completo es donde la diferencia se hace visible: $14,40 en tts-1-hd frente a $48 en los modelos más avanzados de ElevenLabs, por unas nueve horas de audio. Un narrador humano cuesta mucho más por hora terminada que cualquier columna de esa tabla, así que cada opción aquí es una fracción del precio de reservar un estudio.

Un millón de caracteres al mes

A escala de app, los niveles se separan. Un producto que convierte en voz un millón de caracteres al mes paga entre $15 y $100 según el proveedor y el modelo. Ojo con los reintentos: si regeneras cada tercer clip, suma un tercio a todas las cifras. Guarda en caché el audio de frases repetidas, como saludos y mensajes de error, porque el mismo texto nunca necesita pagarse dos veces.

TTS de OpenAI frente a ElevenLabs

La tabla de costos muestra quién es más barato. No muestra quién suena mejor para tu caso de uso, ni qué pasa cuando tu guion es más largo de lo que admite una sola solicitud.

Dos compañeros comparando opciones de texto a voz en un escritorio compartido, uno señalando un equipo portátil mientras el otro toma notas

FactorOpenAI tts-1-hdElevenLabs Flash v2.5ElevenLabs Multilingual v2 y v3
Precio de la API por 1.000 caracteres$0,030$0,05$0,10
IdiomasUnos 993229 (v2), más de 70 (v3)
Máximo de caracteres por solicitud4.09640.00010.000 (v2), 5.000 (v3)
Voces integradas9Biblioteca amplia más clonación de vozBiblioteca amplia más clonación de voz
Enfoque en velocidadMenor latencia en tts-1Unos 75 ms según el proveedorMayor calidad, más lento

Las cifras de ElevenLabs proceden de desgloses de precios de mediados de 2026. La empresa actualiza sus planes con frecuencia, así que confirma las cifras vigentes en su página de precios antes de fijar un presupuesto.

Precio por 1.000 caracteres

En la API, tts-1 está en $0,015, tts-1-hd en $0,030, ElevenLabs Flash y Turbo en $0,05, y Multilingual v2 y v3 en $0,10. Eso hace que ElevenLabs Flash cueste unas 1,7 veces más que tts-1-hd, y sus modelos más avanzados unas 3,3 veces más. En cambio, las suscripciones incluyen créditos: el plan gratuito incluye 10.000 créditos al mes, con un crédito por carácter en los modelos estándar y medio crédito en Flash y Turbo.

Calidad de voz y expresión

El precio es solo la mitad de la historia. ElevenLabs construyó su reputación con una entrega expresiva y natural, y Eleven v3 añade rango emocional y diálogos con varios hablantes en más de 70 idiomas. La respuesta de OpenAI es la capacidad de ajuste: gpt-4o-mini-tts acepta instrucciones en lenguaje natural sobre acento, tono, velocidad y emoción, algo que ninguno de los dos modelos tts-1 puede hacer.

Si necesitas un reparto de personajes que suenen distintos en cada escena, la biblioteca de voces y la clonación de ElevenLabs te dan más margen. Si necesitas una sola voz fiable y barata, OpenAI gana en costo. La única prueba honesta es pasar el mismo párrafo por ambos y escucharlo.

Límites, idiomas y licencias

Los límites de solicitud condicionan tu código. OpenAI limita la entrada a 4.096 caracteres y Eleven v3 a 5.000, así que un guion largo necesita fragmentación y una forma de mantener la voz coherente entre partes. Flash v2.5 admite 40.000 caracteres, lo que significa menos uniones en lecturas largas.

Las licencias también difieren. El plan gratuito de ElevenLabs no tiene licencia comercial, y los derechos comerciales empiezan con el primer plan de pago. OpenAI exige avisar a los usuarios finales de que la voz es generada por IA. Lee ambos conjuntos de condiciones antes de enviar audio a tus clientes.

Cómo usar ElevenLabs v3 en PicassoIA

Antes de pagar por carácter, puedes escuchar el lado de ElevenLabs de esta comparación en el navegador. La colección de texto a voz de PicassoIA incluye 24 modelos, entre ellos ElevenLabs v3, Flash v2.5, Turbo v2.5 y Multilingual v2, además de opciones de MiniMax, Google, Inworld y Resemble AI. Pega un guion, elige una voz y el audio está listo en segundos.

Joven con gorro de punto escuchando una muestra de voz de IA con un solo auricular junto a una ventana

Pasos en el navegador

  1. Abre la página de ElevenLabs v3 en la colección de texto a voz.
  2. Pega tu guion en el campo Prompt.
  3. Elige una voz en el desplegable. La predeterminada es Rachel, y la lista tiene más de 25 perfiles de voz.
  4. Define el código de idioma. El predeterminado es en; usa es u fr para español o francés.
  5. Deja la estabilidad en 0,5, el refuerzo de similitud en 0,75, el estilo en 0 y la velocidad en 1 para la primera prueba.
  6. Ejecuta el modelo, escucha, ajusta un parámetro cada vez y descarga el archivo que más te guste.

Ajustes que cambian el resultado

  • Estabilidad: los valores altos mantienen la voz constante a lo largo de un guion largo; los bajos permiten más variación.
  • Estilo: un control deslizante de 0 a 1 que pasa de una narración neutra a una lectura más teatral.
  • Velocidad: de 0,25x a 4x, útil para ralentizar la narración de tutoriales.
  • Texto anterior y posterior: pega las frases antes y después de un fragmento para que la entonación siga natural en la unión. Es la solución a los límites de caracteres por solicitud mencionados antes.

Para una prueba A/B rápida, pasa el mismo párrafo por Flash v2.5 por su velocidad, MiniMax Speech 2.8 HD para una calidad de estudio, Gemini 3.1 Flash TTS por sus 30 voces y más de 70 idiomas, y Inworld TTS 1.5 Max para locuciones multilingües rápidas. Después compara los resultados con una muestra de tts-1-hd de tu propia cuenta.

También música y transcripción

La voz rara vez es el único trabajo de audio. Un video de producto necesita una base musical, y un podcast necesita una transcripción para subtítulos y búsqueda.

Músico en un escritorio de madera con un controlador de pads y un monitor de estudio bajo una luz cálida de atardecer, componiendo una pista

Genera música. Para una pista de fondo, prueba MiniMax Music 2.6, Lyria 3 Pro, ElevenLabs Music o Stable Audio 2.5. Describe el género, el ambiente y el tempo en una frase y deja que el modelo prepare la pista.

Periodista en una cafetería escribiendo en un equipo portátil junto a una pequeña grabadora de voz y un capuchino, convirtiendo una entrevista en texto

Transcribe audio. Para convertir una narración terminada o una entrevista en texto, usa GPT-4o Transcribe, GPT-4o Mini Transcribe o Gemini 3 Pro. Una transcripción sirve como subtítulos, notas de programa y revisión ortográfica: si la transcripción malinterpreta una palabra, es probable que el oyente también la malinterprete.

Un flujo sencillo une todo: escribe el guion, renderiza la voz, añade una base musical y transcribe la mezcla final para revisar la redacción.

Pruébalo tú mismo hoy

Las tablas de precios solo llegan hasta cierto punto. La forma más rápida de decidir entre OpenAI y ElevenLabs es escuchar tu propio guion en varias voces y ver cuánto cuesta cada opción con tu volumen. Abre PicassoIA, pega un párrafo en un modelo de texto a voz y compáralo con un clip de tts-1-hd. Luego añade una pista musical, transcribe el resultado y genera unas cuantas imágenes fotorrealistas para la portada de tu episodio o video. Todo lo necesario para probar un flujo de trabajo completo de audio y visual está en un solo lugar, así que experimenta con libertad y quédate con la combinación que mejor suene.

Compartir este artículo

Elige tu idioma