Comparativa de APIs de voz en tiempo real: precios de OpenAI, Gemini y Grok

Las APIs de voz en tiempo real cobran por tokens o por minuto, y la diferencia es grande. Este desglose compara los precios de OpenAI gpt-realtime-2.1, Google Gemini 3.8 Live y xAI Grok Voice lado a lado, con un ejemplo de un minuto, presupuestos de 10.000 y 100.000 minutos y los costos ocultos que inflan la factura.

Comparativa de APIs de voz en tiempo real: precios de OpenAI, Gemini y Grok
Cristian Da Conceicao
Fundador de Picasso IA

Tres proveedores venden ya modelos de voz a voz a través de un socket en vivo, y cobran de tres formas distintas. OpenAI mide los tokens de audio. Google también mide tokens de audio, pero además publica un equivalente por minuto. xAI no usa tokens y cobra una tarifa plana por cada minuto que la conexión permanece abierta. Esa diferencia por sí sola hace engañosa una comparación basada en el precio de catálogo. Un asistente de voz que cuesta un centavo por minuto en una hoja de cálculo puede costar diez veces más cuando entran en juego las conversaciones reales, el contexto creciente y las llamadas a herramientas.

Este desglose pone las tres APIs de voz en tiempo real en igualdad de condiciones. Encontrarás las tarifas publicadas según se revisaron el 8 de octubre de 2026, un ejemplo práctico de un minuto, un presupuesto mensual para 10.000 y 100.000 minutos, y los costos ocultos que modifican la factura después del lanzamiento. Al final hay una forma económica de prototipar voces, música y transcripciones en PicassoIA antes de decidirte por cualquiera de las tres.

Las manos de un desarrollador junto a una calculadora y un recibo impreso sobre un escritorio de madera

Precios en tiempo real de OpenAI

La oferta actual de OpenAI, lanzada el 6 de julio de 2026, es gpt-realtime-2.1 y gpt-realtime-2.1-mini. Ambos añaden un esfuerzo de razonamiento configurable sobre la voz a voz, además de un mejor manejo de cadenas alfanuméricas, silencios, ruido de fondo e interrupciones. OpenAI también informó de una reducción de al menos el 25% en la latencia p95 de sus modelos en tiempo real, gracias a un caché mejorado.

Tarifas de gpt-realtime-2.1

Todos los precios son por 1 millón de tokens.

Tipo de tokenEntradaEntrada en cachéSalida
Texto$4.00$0.40$24.00
Audio$32.00$0.40$64.00

La entrada de imágenes se cobra a $5.00 por millón de tokens. El modelo anterior, gpt-realtime-2, tiene precios idénticos, mientras que gpt-realtime-1.5 y el gpt-realtime original mantienen las mismas tarifas de audio, pero cobran $16.00 por millón de tokens de salida de texto. El salto a $24.00 llegó con la línea 2.x, que incorpora razonamiento.

La alternativa mini

gpt-realtime-2.1-mini cuesta aproximadamente un tercio del modelo insignia en audio.

Tipo de tokenEntradaEntrada en cachéSalida
Texto$0.60$0.06$2.40
Audio$10.00$0.30$20.00

La entrada de imágenes baja a $0.80 por millón de tokens. Una medición publicada sobre unas 4.000 sesiones reales con el modelo mini encontró que un asistente típico se sitúa entre $0.05 y $0.08 por minuto, mientras que las llamadas intensas de preguntas y respuestas llegaron a entre $0.12 y $0.15.

Descuento por audio en caché

La línea más barata de la lista de precios de OpenAI es la entrada de audio en caché: $0.40 en lugar de $32.00 en el modelo insignia, un recorte de cerca del 99%. El caché premia un prefijo estable, es decir, tu prompt de sistema y los turnos anteriores de la conversación. Cualquier cambio al inicio del contexto rompe el descuento. La misma medición encontró que inyectar resultados de recuperación nuevos a mitad de llamada reinicia el caché y cuesta aproximadamente entre $0.007 y $0.009 por evento.

Una agente de atención al cliente en un centro de llamadas hablando con un cliente a través de unos auriculares

Precios de Gemini Live

Google vende sus modelos de voz en tiempo real a través de la API Live, y su lista de precios es la más fácil de leer, porque publica tanto una tarifa por token como una cifra por minuto.

Tarifas de Gemini 3.8 Live

gemini-3.8-live y gemini-3.8-live-extended-thinking comparten una misma lista de precios en el plan de pago.

TipoPor 1M de tokensPor minuto
Entrada de texto$0.75n/a
Entrada de audio$3.00$0.005
Entrada de imagen o video$1.00$0.002
Salida de texto$4.50n/a
Salida de audio$12.00$0.018

Las dos columnas cuadran a 25 tokens de audio por segundo, así que puedes presupuestar por tiempo o por tokens y llegar al mismo resultado. Un minuto de habla del asistente cuesta $0.018, y un minuto de habla del cliente cuesta medio centavo.

💡 Consejo: Google es el único de los tres que publica un equivalente por minuto para la facturación por tokens. Si tu equipo financiero quiere una tarifa por minuto de llamada, Gemini te la da sin ninguna conversión.

Dos compañeros compartiendo un equipo portátil y un teléfono en una mesa de trabajo luminosa

Nivel gratuito y modelos de traducción

Existe un nivel gratuito para los modelos Live, lo que convierte a Gemini en el lugar natural para prototipar sin costo antes de pasar al plan de pago. Hay dos modelos afines en la misma página que conviene conocer:

  • Gemini 3.5 Live Translate (vista previa): traducción de voz a voz en más de 70 idiomas, a $3.50 por millón de tokens de entrada ($0.0053 por minuto) y $21.00 por millón de tokens de salida ($0.0315 por minuto).
  • Gemini 3.5 Transcribe Live: conversión de voz a texto en streaming, a $3.50 por millón de tokens de entrada ($0.005 por minuto) y $21.00 por millón de tokens de salida de texto ($0.004 por minuto).

La versión anterior, la vista previa de Gemini 2.5 Flash Native Audio, sigue apareciendo en la lista, a $3.00 por millón de tokens de entrada de audio y $12.00 por millón de tokens de salida de audio.

Precios de Grok Voice

xAI ha optado por el enfoque contrario. No hay tokens de audio que contar, solo minutos.

Tarifa plana por minuto

La Voice Agent API ejecuta grok-voice-think-fast-2.0, también accesible mediante el alias grok-voice-latest. La página de precios de xAI lo sitúa en $0.08 por minuto, o $4.80 por hora. Los primeros informes del lanzamiento citaban $0.05 por minuto, así que confirma la página actual antes de construir una previsión sobre cualquiera de las dos cifras.

La facturación se basa en el tiempo de conexión. Un minuto de silencio cuesta lo mismo que un minuto de conversación, y no hay contexto que volver a cobrar en cada turno. Para un equipo que teme las facturas sorpresa, esa previsibilidad es lo que ofrece el producto. Otras partidas relacionadas de la misma página:

  • Voz a texto: $0.10 por hora en REST, $0.20 por hora en streaming.
  • Texto a voz: $15.00 por millón de caracteres.

Voces, idiomas y enrutamiento telefónico

La API admite más de 20 idiomas con acentos de calidad nativa, y los productos de voz a voz y de texto a voz comparten un mismo catálogo de voces. También puedes crear voces personalizadas a partir de un fragmento de audio de referencia. El soporte de herramientas incluye llamadas a funciones, búsqueda de archivos, búsqueda web, búsqueda en X y servidores MCP remotos.

Para telefonía, xAI documenta la integración SIP con G.711 nativo, orientada al tráfico PSTN, de centros de contacto y PBX. Algunos artículos de terceros añaden varias cifras que la página de precios no confirmó cuando lo revisé: sesiones limitadas a 30 minutos, 100 sesiones simultáneas por equipo, un cargo de $5 por cada 1.000 llamadas de búsqueda web y en X, y $0.01 por minuto adicional por un número de teléfono aprovisionado. Trátalas como datos informados, no como garantizados.

Una mujer con un impermeable hablando por su teléfono mientras camina por una calle de la ciudad

Tabla comparativa de costos

Unidades de facturación distintas necesitan un mismo escenario compartido. El que sigue es deliberadamente sencillo.

Un minuto de conversación

Supuestos: en una ventana de 60 segundos, el cliente habla durante 25 segundos y el asistente habla durante 25 segundos. El audio de OpenAI se cuenta a unos 100 tokens por segundo, la tasa observada en la medición de sesiones reales mencionada antes. El audio de Gemini se cuenta a sus 25 tokens por segundo publicados. Grok se factura por tiempo de conexión. El texto, las herramientas y el contexto creciente se dejan fuera a propósito.

API y modeloUnidad de facturaciónCosto por minuto
OpenAI gpt-realtime-2.1Tokens de audiounos $0.240
OpenAI gpt-realtime-2.1-miniTokens de audiounos $0.075
Gemini 3.8 LiveTokens de audiounos $0.010
Grok grok-voice-think-fast-2.0Tiempo de conexión$0.080

La cuenta del modelo insignia es 2.500 tokens de entrada a $32.00 por millón ($0.080) más 2.500 tokens de salida a $64.00 por millón ($0.160). El modelo mini es la misma suma con $10.00 y $20.00. Gemini equivale a 0,4167 de minuto de audio del cliente a $0.005 más 0,4167 de minuto de audio del asistente a $0.018.

Solo con el audio, Gemini es unas 25 veces más barato que gpt-realtime-2.1 y unas 8 veces más barato que el modelo mini y que Grok.

💡 Lee esta tabla como un mínimo. Solo tiene en cuenta el audio. Las sesiones reales añaden tokens de texto, razonamiento, llamadas a herramientas e historial de conversación, que la siguiente sección desglosa.

10.000 minutos al mes

Escalar ese mínimo a una carga real muestra dónde cambia la conversación sobre el presupuesto.

API y modelo10.000 minutos100.000 minutos
OpenAI gpt-realtime-2.1$2,400$24,000
OpenAI gpt-realtime-2.1-mini$750$7,500
Gemini 3.8 Liveunos $96unos $960
Grok grok-voice-think-fast-2.0$800$8,000

Con 10.000 minutos, la diferencia entre la opción más barata y la más cara supera los $2,300 al mes. Con 100.000 minutos, pasa de $23,000. Con el volumen menor, la mayoría de los equipos elegirán por calidad y funciones y no por precio.

Tres tazas blancas de cerámica junto a pilas de monedas de distinta altura sobre una encimera de cocina

Costos ocultos que inflan la factura

El mínimo de la tabla es donde terminan las buenas noticias. Cuatro factores empujan las facturas reales por encima de él.

El contexto se acumula

Con la facturación por tokens, cada turno puede volver a enviar la conversación hasta ese momento. En el turno 20 estás pagando otra vez por los 19 intercambios anteriores, a menos que el caché o la poda del historial los absorban. En la medición de 4.000 sesiones, una llamada sin podar creció hasta 480.000 tokens y costó $2.05 por una sola sesión. Además, la salida de audio domina la factura, con alrededor del 80% del gasto en el modelo mini.

Tres hábitos ayudan a controlarlo:

  1. Limita la longitud de las respuestas. Respuestas más cortas reducen el gasto entre un 20% y un 40%.
  2. Poda el historial. Resume los turnos antiguos en lugar de reproducirlos.
  3. Mantén estable el prefijo. En OpenAI, esa es la diferencia entre $32.00 y $0.40 por millón de tokens de entrada de audio.

La tarifa plana de Grok evita por completo los dos primeros, y es el argumento más sólido a su favor en llamadas largas.

Herramientas y tokens de razonamiento

Los modelos 2.1 de OpenAI permiten configurar el esfuerzo de razonamiento. Un esfuerzo mayor mejora los turnos difíciles con herramientas, pero añade tokens de salida y latencia, y el texto de salida ahora cuesta $24.00 por millón. Usa un esfuerzo bajo en llamadas tipo preguntas frecuentes y reserva el razonamiento solo para los casos en que una respuesta errónea cueste más de unos pocos centavos.

Las llamadas a herramientas tienen sus propias partidas. La recuperación inyectada a mitad de llamada puede reiniciar el caché, las búsquedas se facturan por separado en Grok y un número de teléfono añade una tarifa por minuto en las configuraciones de telefonía. Si le das a un cliente un precio para un agente de voz, la medición anterior sugiere entre $0.15 y $0.20 por minuto para el modelo mini, para aguantar las sesiones en el peor de los casos.

Una mano sosteniendo un recibo de papel largo que se curva sobre el borde de una mesa de madera

Qué API encaja con tu producto

El precio es un factor. La opción correcta depende de cuánto duran las llamadas, cuántas hay y cuánto cuesta un error.

Agentes telefónicos

El tráfico de los centros de contacto significa llamadas largas, enrutamiento SIP y un equipo financiero que odia la variabilidad. La facturación por tiempo de conexión de Grok y su soporte SIP documentado hacen que la factura sea fácil de prever. Si las llamadas requieren mucho razonamiento y uso de herramientas, como reprogramaciones, cambios de pedidos o consultas de cuentas, gpt-realtime-2.1 es el modelo diseñado en torno al razonamiento configurable, y un minuto a $0.24 puede seguir siendo mejor que una llamada fallida.

Asistentes dentro de apps

Para apps de consumo con un volumen enorme y turnos cortos, Gemini 3.8 Live gana en costo por un margen amplio, y su nivel gratuito elimina fricciones en la fase de prototipo. gpt-realtime-2.1-mini se sitúa en el término medio: tres veces más barato que el modelo insignia, con la misma forma de API.

SituaciónMejor opciónMotivo
Millones de turnos de voz cortosGemini 3.8 LiveLas tarifas de audio más bajas, con cifras por minuto publicadas
Llamadas largas de soporte por SIPGrok Voice Agent$0.08 plano por minuto, sin volver a cobrar el contexto
Llamadas complejas con muchas herramientasgpt-realtime-2.1Esfuerzo de razonamiento configurable
Equilibrio entre costo y calidadgpt-realtime-2.1-miniUn tercio de la tarifa de audio del modelo insignia
Prototipo con presupuesto ceroNivel gratuito de GeminiSin cargo mientras pruebas

Una panadera contestando un teléfono fijo mientras empaqueta pasteles en el mostrador de la tienda

Prototipa las voces antes de pagar

Una API en tiempo real empieza a cobrar desde el primer segundo de audio, así que define antes la voz, el guion y el tono en un lugar más barato. PicassoIA tiene 24 modelos de texto a voz, incluidas voces de los mismos proveedores que estás comparando: Gemini 3.1 Flash TTS y Grok Text To Speech. Para pruebas centradas en la latencia también están Inworld Realtime TTS 2, Realtime TTS 1.5 Mini, con síntesis de 120 ms, y Realtime TTS 1.5 Max, con salida por debajo de 200 ms.

Cómo usar Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS ofrece 30 voces en más de 70 idiomas, un abanico suficiente para probar la voz de una marca en pocos minutos.

  1. Abre la página del modelo e inicia sesión en PicassoIA.
  2. Pega tu guion. Escribe como habla la gente: frases cortas, contracciones y una idea por línea.
  3. Elige una voz de la lista de 30 y configura el idioma de tu guion.
  4. Genera y escucha. Revisa los números, los nombres y las direcciones de correo, las mismas cadenas que hacen tropezar a los agentes en vivo.
  5. Repite el mismo guion en Grok Text To Speech y compara el tono lado a lado.
  6. Descarga el audio que prefieras y compártelo con tu equipo antes de escribir cualquier código.

💡 Consejo: Guarda un guion de prueba fijo de 5 a 6 líneas que incluya un número de teléfono, un precio y un nombre propio. Usar siempre las mismas líneas hace que las comparaciones de voces sean justas.

Un podcaster con auriculares de estudio sentado frente a un escritorio con un micrófono de condensador

La música y las transcripciones completan el conjunto

Un producto de voz rara vez necesita solo habla. Para la música de espera, una sintonía de entrada o una base sonora de marca, Lyria 3 y Music 2.6 generan pistas originales a partir de un prompt de texto. En sentido contrario, GPT 4o Transcribe, GPT 4o Mini Transcribe y Gemini 3 Pro convierten en texto las grabaciones de llamadas de prueba, para que puedas leer lo que dijo realmente el agente en lugar de reproducirlo.

Un joven músico tocando un controlador de música compacto en un pequeño estudio en casa

Crea tu propia demo de voz

Las cifras de arriba cambiarán, así que repite el cálculo de un minuto con la duración de tus llamadas y tu proporción de habla antes de aprobar un proveedor. Empieza hoy por el lado creativo: escribe un guion, genera una voz, añade una base musical, después transcribe el resultado y léelo en voz alta. Todo ello funciona en PicassoIA sin escribir una sola línea de código de integración.

Elige un modelo de voz, pega un guion y escucha cómo suena cada opción antes de que llegue la primera factura. Cuando estés listo para más, explora todos los modelos en PicassoIA y sigue probando voces, música, transcripciones e imágenes hasta que la demo suene como quieres que suene tu producto.

Compartir este artículo

Elige tu idioma