Precios de APIs de voz a texto: las APIs de transcripción más baratas comparadas

Una comparación lado a lado de los precios de las APIs de voz a texto, con cada tarifa convertida a costo por hora, desde $0.04 hasta $1.44. Consulta las facturas mensuales con 100 y 1000 horas de audio, los cargos adicionales que inflan las facturas y cómo probar primero la precisión con tus propias grabaciones.

Precios de APIs de voz a texto: las APIs de transcripción más baratas comparadas
Cristian Da Conceicao
Fundador de Picasso IA

Una hora de audio puede costar $0.04 para transcribirla con una API de voz a texto y $1.44 con otra. La misma grabación, las mismas palabras, una diferencia de 36 veces en la factura. Esa diferencia es la razón por la que los precios de las APIs de voz a texto merecen una comparación lado a lado antes de conectar nada a producción. Este artículo convierte cada tarifa a la misma unidad, ordena las transcripciones más baratas y muestra cuánto cuesta cada una con 100 y 1000 horas de audio al mes. También verás los cargos adicionales que duplican una factura en silencio, los casos en los que los modelos de bajo precio pierden precisión y cómo probar tres modelos de transcripción en PicassoIA sin escribir una sola línea de código.

💡 Cada tarifa de esta página es un precio de pago por uso publicado por el proveedor, no un precio de PicassoIA. Los proveedores las revisan con frecuencia, así que confirma la cifra actual en la página de precios del proveedor antes de comprometerte.

Cuánto cuesta realmente la transcripción

Casi todos los proveedores cobran por duración del audio, no por número de palabras ni por tamaño del archivo. Suena sencillo hasta que comparas cotizaciones. Algunos publican dólares por minuto, otros por hora, y unos pocos esconden la cifra útil detrás de una regla de facturación. Lo primero es poner todo en la misma unidad.

Tarifas por minuto frente a tarifas por hora

Cronómetro de acero cepillado junto a unos auriculares de estudio sobre un escritorio de roble oscuro

La conversión es una sola operación: multiplica la tarifa por minuto por 60 para obtener el costo por hora. Una tarifa de $0.003 por minuto equivale a $0.18 por hora. Una tarifa de $0.024 por minuto equivale a $1.44 por hora. Los proveedores eligen la unidad que hace que el número parezca más pequeño, así que haz la conversión tú mismo antes de comparar nada.

A gran escala es donde los decimales empiezan a pesar. Una tarifa de $0.0025 por minuto parece no significar nada hasta que notas que un archivo de 500 horas son 30 000 minutos, y que ese mismo archivo cuesta $75 con un proveedor y $720 con otro.

Precios por lote frente a precios en streaming

Transcribir un archivo ya terminado (en lote, a veces llamado pregrabado) es la vía barata. La transcripción en vivo (streaming) cuesta más porque el proveedor tiene que mantener abierta capacidad de GPU mientras hablas. La diferencia no es pequeña:

  • AssemblyAI cobra $0.15 por hora por Universal-2 en lote y $0.45 por hora por el modelo en tiempo real Universal-3.5 Pro.
  • Deepgram indica que Nova-3 cuesta aproximadamente $0.0043 por minuto para audio pregrabado y unos $0.0077 por minuto en streaming, con una promoción de streaming por tiempo limitado cercana a $0.0048.
  • Google Cloud baja a aproximadamente $0.003 a $0.004 por minuto en su modo de lote dinámico con descuento, frente a $0.016 para las solicitudes estándar en tiempo real.

Si transcribes grabaciones a posteriori, nunca pagues tarifas de streaming. Sube el archivo y espera unos segundos. Reserva el streaming para los subtítulos en vivo, los agentes de voz y cualquier caso en el que una persona espere las palabras en tiempo real.

Tabla de precios de APIs de voz a texto

Estas son todas las opciones principales convertidas a las mismas dos unidades y ordenadas de la más barata a la más cara. Las tarifas corresponden al primer nivel de uso, en inglés, sin complementos.

Proveedor y modeloPor horaPor minutoMejor opción para
Groq Whisper Large v3 Turbo$0.04~$0.0007Grandes acumulados, máxima velocidad
AssemblyAI Universal-2$0.15$0.0025Lote de bajo costo con extras
GPT-4o Mini Transcribe$0.18$0.003Uso general, presupuestos ajustados
AssemblyAI Universal-3.5 Pro$0.21$0.0035Audio difícil a bajo costo
Deepgram Nova-3 (pregrabado)~$0.26~$0.0043Herramientas para desarrolladores, volumen
GPT-4o Transcribe$0.36$0.006Acentos y audio desordenado
Google Cloud Speech-to-Text V2$0.96$0.016Equipos que usan Google Cloud
Azure Speech (estándar)$1.00~$0.0167Ecosistema de Microsoft
AWS Transcribe (Nivel 1)$1.44$0.024Flujos de trabajo nativos de AWS

💡 Whisper large v3 en la API propia de OpenAI cuesta $0.006 por minuto, lo mismo que GPT-4o Transcribe. Cuando el precio es idéntico, el modelo más reciente es la opción más segura para acentos y ruido de fondo.

Las opciones más baratas por debajo de $0.25 la hora

Estudiante universitario con auriculares estudiando en una mesa de biblioteca

Cuatro opciones están por debajo de un cuarto de dólar por hora de audio. Groq es la excepción: Whisper Large v3 Turbo alojado, a $0.04 por hora, funciona cientos de veces más rápido que el tiempo real, así que una hora de audio termina en mucho menos de un minuto. La contrapartida es un conjunto de funciones más reducido, con menos extras integrados que los proveedores especializados.

AssemblyAI Universal-2 a $0.15 por hora es la opción más barata que todavía incluye un conjunto completo de funciones opcionales, y su modelo Universal-3.5 Pro añade precisión por $0.06 más por hora. GPT-4o Mini Transcribe queda en $0.18 por hora y es el punto justo para estudiantes, creadores independientes y equipos pequeños que quieren buena precisión sin gestionar un montón de cuentas de proveedores.

Las grandes nubes cuestan más

Largo pasillo de centro de datos flanqueado por bastidores de servidores negros

Google Cloud, Azure y AWS cobran entre $0.96 y $1.44 por hora por la transcripción estándar. Eso equivale a entre 6 y 36 veces el nivel de presupuesto. No pagas por mejores palabras. Pagas por certificaciones de cumplimiento, residencia regional de datos, inicio de sesión único y la comodidad de una sola factura que ya existe en tu sistema financiero.

Si tu empresa ya funciona en una de esas nubes y el área legal exige que el audio se quede dentro de ella, el sobrecosto tiene sentido. Si no es así, el sobrecosto es un cargo por pura inercia. El modo de lote con descuento de Google es la excepción, ya que lleva el costo cerca del nivel medio, a unos $0.18 a $0.24 por hora.

Costo mensual con volúmenes reales

Las tarifas por minuto solo se vuelven reales cuando las multiplicas por tu carga de trabajo. Esta tabla usa 100 y 1000 horas de audio al mes, solo con tarifas base.

Opción100 horas al mes1000 horas al mes
Groq Whisper Large v3 Turbo$4$40
AssemblyAI Universal-2$15$150
GPT-4o Mini Transcribe$18$180
AssemblyAI Universal-3.5 Pro$21$210
Deepgram Nova-3 (pregrabado)~$26~$258
GPT-4o Transcribe$36$360
Google Cloud V2$96$960
Azure Speech$100$1,000
AWS Transcribe$144$1,440

Un productor de podcasts con 100 horas

Imagina una cadena que publica 50 episodios de dos horas al mes. Eso son 100 horas de audio. La opción más barata cuesta $4 y la más cara $144, una diferencia de $140 al mes. A ese volumen, la factura no es el problema. Una sola hora dedicada a corregir una mala transcripción cuesta más que toda la factura mensual en la mayoría de estas opciones, así que elige primero por precisión y flujo de trabajo, y usa el precio como criterio de desempate.

Un archivo de llamadas con 1000 horas

Ahora escala a un equipo de soporte que graba 1000 horas de llamadas al mes. La diferencia entre la opción más barata y la más cara pasa a ser de $1,400 al mes, o $16,800 al año. Las opciones de nivel medio, entre $150 y $360 al mes, ahora tienen un impacto real, y ese es el rango en el que probar dos o tres proveedores con tu propio audio se amortiza en una sola tarde.

Cargos ocultos que inflan las facturas

El precio anunciado es solo la transcripción base y nada más. Las facturas reales se construyen con la tarifa base más todo lo que actives.

Los complementos se acumulan

Manos de un contador revisando una factura impresa junto a una calculadora

Las etiquetas de hablantes, el filtro de groserías, la anonimización de datos personales, la detección de idioma, las etiquetas de sentimiento y los resúmenes suelen cobrarse por separado. Los cargos típicos son estos:

  • Etiquetas de hablantes (diarización): alrededor de $0.02 por hora en AssemblyAI, y hasta unos $0.12 por hora en otros proveedores.
  • Anonimización: alrededor de $0.12 por hora en los ejemplos publicados por Deepgram.
  • Cargos por función en Azure: $0.30 por hora por cada una de estas: identificación de idioma, diarización y evaluación de pronunciación.

Activa tres o cuatro de esas funciones y una tarifa base de $0.15 puede duplicarse o más. Calcula siempre el conjunto exacto de funciones que necesita tu producto, no la cifra destacada.

💡 Los niveles gratuitos te permiten probar antes de pagar. Deepgram ofrece un crédito inicial de $200, AssemblyAI concede una asignación de crédito gratuito, Google incluye 60 minutos gratis al mes y AWS incluye 60 minutos gratis al mes durante el primer año.

Las reglas de facturación importan tanto como los complementos. AWS Transcribe cobra un mínimo de 15 segundos por solicitud, así que una aplicación de comandos de voz que envía clips de 3 segundos paga cinco veces el audio que realmente envía. Los límites de carga también importan: los endpoints de transcripción de OpenAI aceptan archivos de hasta unos 25 MB, así que las grabaciones largas necesitan dividirse en fragmentos, y si los fragmentos se solapan, pagas dos veces los segundos solapados.

El tiempo de ingeniería también cuenta

Desarrollador de pie en un escritorio trabajando en código en un loft de ladrillo

Ahorrar $30 al mes en transcripción es un mal negocio si el proveedor más barato le cuesta a tu desarrollador cuatro horas extra. Revisa que haya un SDK en tu lenguaje, webhooks para los trabajos terminados, límites de tasa razonables y mensajes de error claros antes de comprometerte. Con un costo de ingeniería de $75 por hora, cuatro horas de problemas de integración equivalen a diez meses de ahorro de $30.

Barato frente a preciso

Un precio por hora no dice nada sobre cuántas palabras salen mal. Dos proveedores con la misma tarifa pueden dejarte con cantidades muy distintas de corrección, y la corrección se paga con tiempo humano.

Dónde tropiezan los modelos baratos

Periodista de radio sosteniendo una grabadora de mano hacia un artesano en su taller

Los modelos de bajo costo tienden a fallar en los mismos puntos: acentos marcados, dos personas hablando a la vez, grabaciones de campo con viento o maquinaria, nombres de productos, siglas y números hablados. Cada fallo se convierte en una edición.

Haz la cuenta de la edición. Con una tarifa de $30 por hora, un editor cuesta $0.50 por minuto. Cada 10 minutos extra de corrección por hora de audio suman $5, lo que supera toda la factura de AWS Transcribe por esa hora. Una transcripción que cuesta $0.18 y necesita 20 minutos de arreglos sale más cara que una que cuesta $0.36 y necesita 5.

La única prueba fiable es tu propio audio. Elige tres archivos representativos, pásalos por tres modelos y cuenta las ediciones que haces. Hazlo antes de decidir nada basándote en una gráfica de benchmark.

Reuniones y etiquetas de hablantes

Cuatro colegas alrededor de una mesa de conferencias con un altavoz telefónico

Las reuniones son el caso cotidiano más difícil, porque la transcripción no sirve de nada si no sabes quién dijo cada cosa. Algunos modelos incluyen las etiquetas de hablantes en el precio base, como la variante de diarización del modelo de transcripción de OpenAI, mientras que otros las cobran como complemento. Cuando compares una carga de trabajo centrada en reuniones, añade el cargo de diarización a cada opción de la lista corta y luego compara los totales. La tarifa base más barata con frecuencia deja de ser la más barata en total.

Cómo usar GPT-4o Mini Transcribe

Vista cenital de un escritorio limpio de estudio en casa con equipo portátil, auriculares y micrófono

PicassoIA ofrece tres modelos de voz a texto que puedes probar directamente desde el navegador: GPT-4o Mini Transcribe, GPT-4o Transcribe y Gemini 3 Pro. Eso lo convierte en una forma rápida de hacer la prueba de tres archivos de la sección anterior antes de abrir una sola cuenta de proveedor.

Configuración paso a paso

  1. Abre la página de GPT-4o Mini Transcribe en PicassoIA.
  2. Sube un archivo de audio corto, idealmente un clip de 3 a 5 minutos que incluya tu material más difícil: nombres, números y voces que se superponen.
  3. Si el formulario tiene un campo de idioma, configúralo en lugar de dejar que el modelo lo adivine.
  4. Añade un prompt breve con nombres poco comunes o jerga, si hay un campo para prompts.
  5. Ejecuta la transcripción y lee el resultado comparándolo con el audio.
  6. Repite con GPT-4o Transcribe y Gemini 3 Pro con el mismo clip.
  7. Cuenta las líneas que editarías en cada resultado. El recuento más bajo gana un lugar en tu lista corta.

Consejos de parámetros que ahorran dinero

  • Recorta primero los silencios. La facturación sigue la duración, así que recortar una introducción de 10 minutos sin contenido ahorra 10 minutos de costo en cada proveedor.
  • Configura el idioma. La detección de idioma puede tener un cargo extra en algunas APIs y ser una fuente de errores en clips cortos.
  • Usa un prompt de vocabulario. Una sola línea con nombres de marcas y términos técnicos corrige más errores que cambiar a un modelo más caro.
  • Prueba con clips idénticos. Compara los modelos con el mismo archivo; de lo contrario, las diferencias de calidad de audio se confunden con diferencias de calidad del modelo.

Convierte las transcripciones en voz y música

La transcripción suele ser el primer paso de un flujo más largo. Cuando tienes un texto limpio, puedes reutilizarlo: narrarlo con una voz nueva, traducirlo y regrabarlo, o crear una banda sonora alrededor. PicassoIA reúne esos pasos en un solo lugar.

Vuelve a narrar las transcripciones con voz natural

Actor de voz grabando en una cabina acolchada con una guitarra y un sintetizador detrás de un cristal

Si das una transcripción corregida a un modelo de texto a voz, obtienes una pista de narración limpia sin reservar un estudio. Speech 2.8 HD está orientado a locuciones de calidad de estudio, ElevenLabs v3 se centra en una entrega expresiva, Gemini 3.1 Flash TTS ofrece 30 voces en más de 70 idiomas, y Realtime TTS 2 está pensado para un uso de baja latencia. Este es el ciclo práctico para los podcasters que quieren una edición en otro idioma de cada episodio.

Añade una base musical al resultado

La narración suena terminada cuando tiene debajo una base musical discreta. Music 2.6 genera canciones completas a partir de un prompt de texto, Lyria 3 Pro crea piezas instrumentales más largas, y Stable Audio 2.5 encaja bien con loops cortos y bases ambientales. Describe el ambiente en una frase, mantén la pista instrumental y bájala de 15 a 20 decibelios por debajo de la voz.

Elige tu configuración más barata

Esta es la versión resumida de todo lo anterior:

  • Acumulado de grabaciones antiguas, el precio lo es todo: Groq Whisper Large v3 Turbo a $0.04 por hora.
  • Equipo pequeño, calidad y costo equilibrados: GPT-4o Mini Transcribe a $0.18 por hora.
  • Acentos, ruido y audio difícil: GPT-4o Transcribe a $0.36 por hora, o AssemblyAI Universal-3.5 Pro a $0.21.
  • Reuniones con etiquetas de hablantes: calcula primero el complemento de diarización y luego compara los totales.
  • Atado a una nube por política interna: Google, Azure o AWS, y pide el modo de lote con descuento.

Elijas lo que elijas, trata el primer mes como una prueba. Registra la factura real, divídela entre las horas transcritas y compárala con la tabla de arriba. Los precios cambian, y tus necesidades también. Un proveedor que hoy gana en costo puede perder el próximo trimestre en precisión o en límites, así que mantén tu integración lo bastante sencilla como para cambiar de proveedor con un cambio de una línea, y ten a mano un clip de prueba de 5 minutos para repetirlo cada vez que cambie una tarifa.

¿Lo pones en práctica? Abre PicassoIA, sube una de tus propias grabaciones a GPT-4o Mini Transcribe y luego prueba el mismo clip en los otros modelos de transcripción. Cuando el texto te parezca correcto, narra el resultado con un modelo de texto a voz, añade una base musical y comprueba hasta dónde llega una sola grabación. Explora el catálogo completo en picassoia.com/en/all-models y empieza a experimentar hoy mismo.

Compartir este artículo

Elige tu idioma