API de Google Cloud Text to Speech: precios, voces y nivel gratuito

Precios de la API de Google Cloud Text to Speech con cifras claras: cuánto cuestan por millón de caracteres las voces Standard, WaveNet, Neural2, Chirp 3 HD y Studio, lo grande que es de verdad el nivel gratuito y cómo estimar una factura mensual antes de lanzar, además de alternativas en el navegador.

API de Google Cloud Text to Speech: precios, voces y nivel gratuito
Cristian Da Conceicao
Fundador de Picasso IA

Google Cloud Text to Speech parece barato hasta que llega la primera factura. La cifra principal es $4 por millón de caracteres para las voces básicas, pero las voces que la gente realmente quiere escuchar cuestan entre cuatro y cuarenta veces más, y el cupo gratuito se reduce rápido en cuanto subes a niveles de mayor calidad. Este artículo explica cada nivel de voz, qué incluye de verdad el nivel gratuito mensual, cómo estimar una factura antes de escribir una línea de código y cuándo un modelo de voz IA distinto es la compra más inteligente.

Los precios que aparecen a continuación reflejan las tarifas publicadas por Google a octubre de 2026. Google reorganiza su catálogo de voces con frecuencia, así que trata las cifras como una base para planificar y confírmalas en tu consola de facturación antes de fijar un presupuesto.

Qué hace realmente la API

La API de Cloud Text-to-Speech recibe texto plano o un documento SSML y devuelve audio. Se llama por REST o gRPC, o a través de bibliotecas cliente para Python, Node.js, Java, Go y C#. La autenticación se hace con una cuenta de servicio, así que un backend puede pedir audio sin ningún paso de inicio de sesión humano.

Un desarrollador freelance trabajando en un equipo portátil junto a unos auriculares y una taza, con la luz suave de una ventana por la mañana

Formatos y límites de solicitud

Cada respuesta llega como MP3, LINEAR16 (WAV sin comprimir), OGG_OPUS, MULAW o ALAW. MP3 sirve para la reproducción web, LINEAR16 para la edición, y MULAW o ALAW para los sistemas telefónicos que esperan códecs de telefonía. Una sola llamada acepta unos 5000 bytes de entrada, así que un guion largo debe dividirse en fragmentos y volver a unirse por tu parte.

💡 Consejo: Divide los guiones en los límites de las oraciones, nunca en un número fijo de bytes. Un corte a mitad de una oración deja un salto audible de tono en la unión.

SSML y controles de voz

SSML es el lenguaje de marcado que da forma a la entrega. Con él añades pausas mediante <break>, enfatizas una palabra con <emphasis> y deletreas fechas, números y abreviaturas con <say-as>. Fuera de SSML, la solicitud expone la velocidad de habla (de 0,25x a 4x) y el tono (de menos 20 a más 20 semitonos) como parámetros simples. Google enumera cientos de voces en más de 50 idiomas y variantes, aunque no todos los controles funcionan en todos los niveles de voz.

Tipos de voz y sus precios

Google vende el habla por niveles. El precio depende de la tecnología de voz que hay debajo, no de la duración del audio, así que elegir mal el nivel es el error de presupuesto más común.

Nivel de vozPrecio por 1M de caracteresGratis al mesIdeal para
Standard$44M de caracteresAlertas, prototipos, narración sencilla
WaveNet$4Compartido con StandardUn tono más cálido al mismo precio
Neural2$161M de caracteresLectura natural en la mayoría de apps
Polyglot$16Compartido con Neural2Una misma voz en varios idiomas
Chirp 3 HD$301M de caracteresNarración realista y expresiva
Voz personalizada instantánea$60NingunoUna voz de marca clonada
Studio$160Asignación pequeñaAudio premium de formato largo

💡 Aviso: Las páginas de precios de terceros no coinciden en el cupo gratuito de WaveNet: algunas indican 1M y otras 4M, porque las líneas Standard y WaveNet han cambiado a lo largo de los años. Comprueba las cifras actuales en tu consola antes de confiar en la más alta.

Una regla rápida para elegir: usa Standard cuando el audio sea corto y funcional, Neural2 cuando la gente lo vaya a escuchar a diario, Chirp 3 HD cuando la voz forme parte de la experiencia del producto, y Studio solo después de haber escuchado Chirp 3 HD y encontrarlo insuficiente. Empezar un nivel más abajo y subir después de los comentarios reales de los oyentes mantiene pequeñas las primeras facturas.

Standard y WaveNet

Las voces Standard son las más antiguas y baratas. Suenan claramente sintéticas, con un ritmo uniforme y una emoción plana. Eso basta para una notificación de entrega o una lectura de estado, y los 4 millones de caracteres gratuitos al mes absorberán una cantidad sorprendente de ese tráfico. Las voces WaveNet usan un vocoder neuronal que suaviza el filo robótico. Con las tarifas actuales cuestan lo mismo que Standard, lo que hace difícil justificar Standard para cualquier cosa que una persona escuche más de unos pocos segundos.

Neural2 y Polyglot

Neural2 es el nivel de trabajo diario. La pronunciación es limpia, el ritmo de las oraciones suena natural, y $16 por millón de caracteres es un punto medio razonable. Las voces Polyglot, que la tabla de precios aún etiqueta como versión preliminar, permiten que un mismo hablante cambie de idioma, lo que ayuda a una línea de atención que debe leer un nombre en español dentro de una frase en inglés. Los dos niveles comparten una asignación mensual de 1 millón de caracteres.

Chirp 3 HD y Studio

Chirp 3 HD es la familia premium más nueva de Google, con 30 estilos de voz y nombres como Aoede, Puck, Charon y Kore. A $30 por millón de caracteres cuesta casi el doble que Neural2, pero suena mucho más como un lector humano, con respiraciones y entonación creíbles. Las voces Studio están a $160 por millón de caracteres, cuarenta veces la tarifa de Standard. Chirp 3 HD suele quedarse lo bastante cerca como para que Studio sea difícil de justificar fuera de un grupo reducido de trabajos premium de formato largo.

Cómo funciona el nivel gratuito

Qué cuenta como carácter

La facturación cuenta los caracteres del texto que envías, incluidos los espacios y la puntuación. Una palabra inglesa promedio tiene cinco letras más un espacio, así que una palabra cuesta unos seis caracteres. Con esa cuenta, 1 millón de caracteres equivale a unas 166 000 palabras, o alrededor de 18,5 horas de habla a un ritmo tranquilo de 150 palabras por minuto.

Las asignaciones se reinician cada mes natural y nunca se acumulan. Los caracteres no usados en marzo desaparecen en abril. Además se contabilizan por nivel, así que 900 000 caracteres sobrantes de Neural2 nunca compensarán una factura de Chirp 3 HD.

Vista cenital de un escritorio con una calculadora, facturas impresas y cuentas escritas a mano usadas para estimar el costo de la voz

La facturación debe estar activada

El nivel gratuito no es una prueba sin tarjeta. Hay que asociar una cuenta de facturación al proyecto antes de que la API responda, incluso si nunca sales de la asignación gratuita. Configura una alerta de presupuesto de $5 o $10 el primer día y considera reducir la cuota de la API en la consola para que un bucle descontrolado no produzca una sorpresa de cuatro cifras de la noche a la mañana.

💡 Consejo avanzado: Guarda en caché cada archivo generado. Un saludo que se reproduce 10 000 veces al día debe sintetizarse una vez y almacenarse, no facturarse 10 000 veces.

Lo que cuesta realmente un millón de caracteres

Los precios por carácter parecen diminutos, así que aquí están los mismos niveles calculados sobre cargas de trabajo reales. Cada cifra aplica primero el cupo gratuito del nivel.

Tres ejemplos de factura mensual

Carga de trabajoCaracteresStandardNeural2Chirp 3 HD
200 artículos de blog de 1500 palabras1,8M$0$12,80$24,00
Menú telefónico, 50 000 avisos de 120 caracteres6M$8,00$80,00$150,00
Una novela de 80 000 palabras0,48M$0$0$0

La novela se mantiene dentro de la asignación gratuita en Neural2 o Chirp 3 HD, pero el mismo libro en Studio costaría $76,80 antes de cualquier asignación. La fila del menú telefónico muestra por qué importa la elección de nivel: el mismo tráfico cuesta $8 en Standard y $150 en Chirp 3 HD. Guardar en caché los avisos repetidos suele eliminar la mayor parte de esa diferencia, porque un menú fijo tiene solo unos cientos de frases únicas.

Costo por hora de audio

A 150 palabras por minuto y seis caracteres por palabra, una hora de habla son unos 54 000 caracteres. Precio antes de cualquier asignación gratuita:

NivelCosto por hora de audio
Standard y WaveNet$0,22
Neural2 y Polyglot$0,86
Chirp 3 HD$1,62
Voz personalizada instantánea$3,24
Studio$8,64
Gemini 3.1 Flash TTS (facturado por tokens)Unos $1,81, estimación independiente

Lee estas cifras como el precio de la hora número cien, no de la primera. Los modelos de voz de Gemini de Google facturan de otra manera, por tokens en lugar de caracteres: unos $1 por millón de tokens de texto más $20 por millón de tokens de audio en Gemini 3.1 Flash TTS. El costo depende entonces de la duración del audio que generes, lo cual es más fácil de prever para narraciones y más difícil para asistentes conversacionales.

Dónde encaja mejor la API

Audiolibros y narración

La narración de formato largo es donde la facturación por carácter resulta más previsible. Un libro de diez horas ocupa unos 540 000 caracteres, así que incluso sin ninguna asignación gratuita Chirp 3 HD costaría $16,20 por todo el libro. La contrapartida está en el control de la interpretación. Las voces de Google leen lo que les das, con poco control emocional más allá de SSML, así que la ficción con diálogos suele implicar probar varias voces para varios personajes.

Un narrador leyendo un libro de bolsillo grueso dentro de una cabina de grabación acolchada

Menús telefónicos y atención al cliente

La telefonía es la mejor coincidencia con la lista de formatos de la API. Solicita salida en MULAW o ALAW para que el audio entre directamente en una red telefónica sin conversión, genera una vez los avisos fijos y guarda los archivos, y reserva la síntesis en vivo para las partes que cambian, como nombres y números de pedido. Solo la parte dinámica debería llegar a tu factura.

Una sala luminosa de atención al cliente con agentes con auriculares en escritorios blancos

Asistentes y accesibilidad

Los altavoces inteligentes, las apps de lectura y los asistentes de coche comparten un mismo patrón: respuestas cortas y mucho volumen. Las voces Standard y Neural2 manejan ese tráfico a bajo costo, y un generoso nivel gratuito suele significar que un producto pequeño no paga nada durante meses. La latencia también importa aquí, así que prueba el tiempo de respuesta desde tu propia región antes de comprometerte. Una voz que suena perfecta pero tarda dos segundos en empezar resulta rota en una conversación.

Un altavoz inteligente de carbón mate sobre una encimera de cocina, junto a limones y una taza de café humeante

La accesibilidad es un caso distinto. Quien depende del audio para leer artículos largos escucha la voz durante horas cada día, y un tono sintético plano se vuelve cansado muy rápido. Presupuesta Neural2 o Chirp 3 HD para ese caso y deja que el oyente controle la velocidad.

Un hombre con bastón blanco en una parada de autobús escuchando su teléfono con auriculares

Opciones de voz más allá de Google Cloud

La API está pensada para desarrolladores que manejan un proyecto en la nube, una cuenta de servicio y una consola de facturación. Si necesitas una locución para un video, un prototipo rápido o una narración puntual, esa configuración es una carga. PicassoIA aloja 24 modelos de texto a voz que puedes probar directamente desde el navegador, sin ningún proyecto en la nube que configurar.

Alternativas que vale la pena probar

ModeloFortalezaBuena opción para
Gemini 3.1 Flash TTS30 voces, más de 70 códigos de idioma, etiquetas de emociónNarración expresiva y guiones multilingües
ElevenLabs v3Locuciones naturales y con sonido humanoNarrativa y lecturas de personajes
MiniMax Speech 2.8 HDSalida de calidad de estudioNarración pulida para video
Inworld Realtime TTS 2Dirección de voz en lenguaje naturalAgentes conversacionales
Qwen3 TTSClona una voz o diseña una nuevaVoces de marca personalizadas
ElevenLabs DubbingTraduce videos a más de 90 idiomasLocalizar material ya grabado

Un presentador de podcast hablando frente a un micrófono de condensador con filtro antipop en un estudio cálido

Si tu proyecto necesita una voz propia en lugar de una genérica, MiniMax Voice Cloning crea una voz personalizada a partir de una muestra corta, y evita los $60 por millón de caracteres que Google cobra por una voz personalizada instantánea.

Cómo usar Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS es una buena primera prueba porque sus nombres de voz coinciden con la línea Chirp 3 HD de Google. Aoede, Puck, Charon y Kore aparecen en ambas, lo que facilita las comparaciones lado a lado.

  1. Abre la página del modelo y pega tu guion en el campo de texto. El límite es de 4000 bytes por generación, así que divide los guiones más largos.
  2. Elige una voz entre las 30 opciones. La predeterminada es Kore, y Puck, Charon, Fenrir y Aoede son rápidas para probar primero.
  3. Define el código de idioma. El predeterminado es en-US, y la lista supera los 70 códigos, incluidos es-MX, fr-CA, pt-BR y ja-JP.
  4. Escribe un prompt de estilo en inglés sencillo, como "Di esto con un tono tranquilo y profesional" o "Habla con entusiasmo y energía".
  5. Añade etiquetas expresivas dentro del guion: [whispering], [laughing], [shouting], [sigh] o [extremely fast].
  6. Genera, escucha y descarga el archivo de audio. Cambia un ajuste a la vez para oír qué hace cada uno.
ParámetroQué controlaPunto de partida
VozPersonaje, edad y tonoKore para narración neutra
Código de idiomaAcento y pronunciaciónAjústalo a la región de tu público
Prompt de estiloRitmo, emoción, forma de entregarUna frase corta
Etiquetas de textoExpresión a nivel de fraseDos o tres por párrafo

💡 Consejo: Usa las etiquetas con moderación. Un guion en el que cada línea es [whispering] o [shouting] suena agotador. Úsalas para el contraste, no como decoración.

Música y transcripción junto al habla

El habla rara vez llega sola. Un video necesita una base musical bajo la narración, y el contenido hablado necesita una transcripción para subtítulos, búsqueda y accesibilidad. Google vende la transcripción como producto aparte con su propio contador, así que un proyecto de voz puede acabar con dos líneas de facturación antes de añadir música.

En el terreno musical, Lyria 3 Pro crea canciones completas a partir de un prompt de texto, MiniMax Music 2.6 añade voces y letra, y Stable Audio 2.5 sirve para bases instrumentales que quedan discretas bajo una voz. Pide la música como le darías un encargo a un compositor: género, tempo, instrumentos y ambiente. "Guitarra acústica cálida, 90 BPM, sin prisas, sin voces" da una base que no competirá con la narración.

Un productor musical en un escritorio entre monitores de estudio con un controlador MIDI compacto

Para las transcripciones, GPT-4o Transcribe y Gemini 3 Pro convierten grabaciones en texto, algo útil para notas de reuniones, entrevistas y subtítulos de la narración que acabas de generar.

Vista aérea de colegas alrededor de una mesa de conferencias de cristal con una pequeña grabadora de voz en el centro

Un flujo sencillo funciona bien: escribe el guion, genera la voz, añade una base musical y luego transcribe la mezcla final para producir subtítulos y revisar la pronunciación de los nombres difíciles.

Crea tu primera locución hoy

Las tablas de precios solo dicen hasta cierto punto. La forma más rápida de decidir entre una API en la nube y una herramienta en el navegador es escuchar cómo leen ambas el mismo párrafo. Toma 100 palabras de tu propio proyecto, pásalas por la consola de Google y luego pégalas en Gemini 3.1 Flash TTS o MiniMax Speech 2.8 HD y compara el ritmo, la calidez y la pronunciación lado a lado.

Mientras estés ahí, prueba el resto de la plataforma. Añade una base musical con Lyria 3 Pro, subtitula el resultado con GPT-4o Transcribe y crea tus propias imágenes fotorrealistas para miniaturas y para las ilustraciones de tus artículos con PicassoIA. Experimenta con libertad, cambia una variable a la vez y quédate con la combinación que suene bien. Explora todos los modelos en picassoia.com/en/all-models.

Compartir este artículo

Elige tu idioma