Google Cloud Text to Speech parece barato hasta que llega la primera factura. La cifra principal es $4 por millón de caracteres para las voces básicas, pero las voces que la gente realmente quiere escuchar cuestan entre cuatro y cuarenta veces más, y el cupo gratuito se reduce rápido en cuanto subes a niveles de mayor calidad. Este artículo explica cada nivel de voz, qué incluye de verdad el nivel gratuito mensual, cómo estimar una factura antes de escribir una línea de código y cuándo un modelo de voz IA distinto es la compra más inteligente.
Los precios que aparecen a continuación reflejan las tarifas publicadas por Google a octubre de 2026. Google reorganiza su catálogo de voces con frecuencia, así que trata las cifras como una base para planificar y confírmalas en tu consola de facturación antes de fijar un presupuesto.
Qué hace realmente la API
La API de Cloud Text-to-Speech recibe texto plano o un documento SSML y devuelve audio. Se llama por REST o gRPC, o a través de bibliotecas cliente para Python, Node.js, Java, Go y C#. La autenticación se hace con una cuenta de servicio, así que un backend puede pedir audio sin ningún paso de inicio de sesión humano.

Formatos y límites de solicitud
Cada respuesta llega como MP3, LINEAR16 (WAV sin comprimir), OGG_OPUS, MULAW o ALAW. MP3 sirve para la reproducción web, LINEAR16 para la edición, y MULAW o ALAW para los sistemas telefónicos que esperan códecs de telefonía. Una sola llamada acepta unos 5000 bytes de entrada, así que un guion largo debe dividirse en fragmentos y volver a unirse por tu parte.
💡 Consejo: Divide los guiones en los límites de las oraciones, nunca en un número fijo de bytes. Un corte a mitad de una oración deja un salto audible de tono en la unión.
SSML y controles de voz
SSML es el lenguaje de marcado que da forma a la entrega. Con él añades pausas mediante <break>, enfatizas una palabra con <emphasis> y deletreas fechas, números y abreviaturas con <say-as>. Fuera de SSML, la solicitud expone la velocidad de habla (de 0,25x a 4x) y el tono (de menos 20 a más 20 semitonos) como parámetros simples. Google enumera cientos de voces en más de 50 idiomas y variantes, aunque no todos los controles funcionan en todos los niveles de voz.
Tipos de voz y sus precios
Google vende el habla por niveles. El precio depende de la tecnología de voz que hay debajo, no de la duración del audio, así que elegir mal el nivel es el error de presupuesto más común.
| Nivel de voz | Precio por 1M de caracteres | Gratis al mes | Ideal para |
|---|
| Standard | $4 | 4M de caracteres | Alertas, prototipos, narración sencilla |
| WaveNet | $4 | Compartido con Standard | Un tono más cálido al mismo precio |
| Neural2 | $16 | 1M de caracteres | Lectura natural en la mayoría de apps |
| Polyglot | $16 | Compartido con Neural2 | Una misma voz en varios idiomas |
| Chirp 3 HD | $30 | 1M de caracteres | Narración realista y expresiva |
| Voz personalizada instantánea | $60 | Ninguno | Una voz de marca clonada |
| Studio | $160 | Asignación pequeña | Audio premium de formato largo |
💡 Aviso: Las páginas de precios de terceros no coinciden en el cupo gratuito de WaveNet: algunas indican 1M y otras 4M, porque las líneas Standard y WaveNet han cambiado a lo largo de los años. Comprueba las cifras actuales en tu consola antes de confiar en la más alta.
Una regla rápida para elegir: usa Standard cuando el audio sea corto y funcional, Neural2 cuando la gente lo vaya a escuchar a diario, Chirp 3 HD cuando la voz forme parte de la experiencia del producto, y Studio solo después de haber escuchado Chirp 3 HD y encontrarlo insuficiente. Empezar un nivel más abajo y subir después de los comentarios reales de los oyentes mantiene pequeñas las primeras facturas.
Standard y WaveNet
Las voces Standard son las más antiguas y baratas. Suenan claramente sintéticas, con un ritmo uniforme y una emoción plana. Eso basta para una notificación de entrega o una lectura de estado, y los 4 millones de caracteres gratuitos al mes absorberán una cantidad sorprendente de ese tráfico. Las voces WaveNet usan un vocoder neuronal que suaviza el filo robótico. Con las tarifas actuales cuestan lo mismo que Standard, lo que hace difícil justificar Standard para cualquier cosa que una persona escuche más de unos pocos segundos.
Neural2 y Polyglot
Neural2 es el nivel de trabajo diario. La pronunciación es limpia, el ritmo de las oraciones suena natural, y $16 por millón de caracteres es un punto medio razonable. Las voces Polyglot, que la tabla de precios aún etiqueta como versión preliminar, permiten que un mismo hablante cambie de idioma, lo que ayuda a una línea de atención que debe leer un nombre en español dentro de una frase en inglés. Los dos niveles comparten una asignación mensual de 1 millón de caracteres.
Chirp 3 HD y Studio
Chirp 3 HD es la familia premium más nueva de Google, con 30 estilos de voz y nombres como Aoede, Puck, Charon y Kore. A $30 por millón de caracteres cuesta casi el doble que Neural2, pero suena mucho más como un lector humano, con respiraciones y entonación creíbles. Las voces Studio están a $160 por millón de caracteres, cuarenta veces la tarifa de Standard. Chirp 3 HD suele quedarse lo bastante cerca como para que Studio sea difícil de justificar fuera de un grupo reducido de trabajos premium de formato largo.
Cómo funciona el nivel gratuito
Qué cuenta como carácter
La facturación cuenta los caracteres del texto que envías, incluidos los espacios y la puntuación. Una palabra inglesa promedio tiene cinco letras más un espacio, así que una palabra cuesta unos seis caracteres. Con esa cuenta, 1 millón de caracteres equivale a unas 166 000 palabras, o alrededor de 18,5 horas de habla a un ritmo tranquilo de 150 palabras por minuto.
Las asignaciones se reinician cada mes natural y nunca se acumulan. Los caracteres no usados en marzo desaparecen en abril. Además se contabilizan por nivel, así que 900 000 caracteres sobrantes de Neural2 nunca compensarán una factura de Chirp 3 HD.

La facturación debe estar activada
El nivel gratuito no es una prueba sin tarjeta. Hay que asociar una cuenta de facturación al proyecto antes de que la API responda, incluso si nunca sales de la asignación gratuita. Configura una alerta de presupuesto de $5 o $10 el primer día y considera reducir la cuota de la API en la consola para que un bucle descontrolado no produzca una sorpresa de cuatro cifras de la noche a la mañana.
💡 Consejo avanzado: Guarda en caché cada archivo generado. Un saludo que se reproduce 10 000 veces al día debe sintetizarse una vez y almacenarse, no facturarse 10 000 veces.
Lo que cuesta realmente un millón de caracteres
Los precios por carácter parecen diminutos, así que aquí están los mismos niveles calculados sobre cargas de trabajo reales. Cada cifra aplica primero el cupo gratuito del nivel.
Tres ejemplos de factura mensual
| Carga de trabajo | Caracteres | Standard | Neural2 | Chirp 3 HD |
|---|
| 200 artículos de blog de 1500 palabras | 1,8M | $0 | $12,80 | $24,00 |
| Menú telefónico, 50 000 avisos de 120 caracteres | 6M | $8,00 | $80,00 | $150,00 |
| Una novela de 80 000 palabras | 0,48M | $0 | $0 | $0 |
La novela se mantiene dentro de la asignación gratuita en Neural2 o Chirp 3 HD, pero el mismo libro en Studio costaría $76,80 antes de cualquier asignación. La fila del menú telefónico muestra por qué importa la elección de nivel: el mismo tráfico cuesta $8 en Standard y $150 en Chirp 3 HD. Guardar en caché los avisos repetidos suele eliminar la mayor parte de esa diferencia, porque un menú fijo tiene solo unos cientos de frases únicas.
Costo por hora de audio
A 150 palabras por minuto y seis caracteres por palabra, una hora de habla son unos 54 000 caracteres. Precio antes de cualquier asignación gratuita:
| Nivel | Costo por hora de audio |
|---|
| Standard y WaveNet | $0,22 |
| Neural2 y Polyglot | $0,86 |
| Chirp 3 HD | $1,62 |
| Voz personalizada instantánea | $3,24 |
| Studio | $8,64 |
| Gemini 3.1 Flash TTS (facturado por tokens) | Unos $1,81, estimación independiente |
Lee estas cifras como el precio de la hora número cien, no de la primera. Los modelos de voz de Gemini de Google facturan de otra manera, por tokens en lugar de caracteres: unos $1 por millón de tokens de texto más $20 por millón de tokens de audio en Gemini 3.1 Flash TTS. El costo depende entonces de la duración del audio que generes, lo cual es más fácil de prever para narraciones y más difícil para asistentes conversacionales.
Dónde encaja mejor la API
Audiolibros y narración
La narración de formato largo es donde la facturación por carácter resulta más previsible. Un libro de diez horas ocupa unos 540 000 caracteres, así que incluso sin ninguna asignación gratuita Chirp 3 HD costaría $16,20 por todo el libro. La contrapartida está en el control de la interpretación. Las voces de Google leen lo que les das, con poco control emocional más allá de SSML, así que la ficción con diálogos suele implicar probar varias voces para varios personajes.

Menús telefónicos y atención al cliente
La telefonía es la mejor coincidencia con la lista de formatos de la API. Solicita salida en MULAW o ALAW para que el audio entre directamente en una red telefónica sin conversión, genera una vez los avisos fijos y guarda los archivos, y reserva la síntesis en vivo para las partes que cambian, como nombres y números de pedido. Solo la parte dinámica debería llegar a tu factura.

Asistentes y accesibilidad
Los altavoces inteligentes, las apps de lectura y los asistentes de coche comparten un mismo patrón: respuestas cortas y mucho volumen. Las voces Standard y Neural2 manejan ese tráfico a bajo costo, y un generoso nivel gratuito suele significar que un producto pequeño no paga nada durante meses. La latencia también importa aquí, así que prueba el tiempo de respuesta desde tu propia región antes de comprometerte. Una voz que suena perfecta pero tarda dos segundos en empezar resulta rota en una conversación.

La accesibilidad es un caso distinto. Quien depende del audio para leer artículos largos escucha la voz durante horas cada día, y un tono sintético plano se vuelve cansado muy rápido. Presupuesta Neural2 o Chirp 3 HD para ese caso y deja que el oyente controle la velocidad.

Opciones de voz más allá de Google Cloud
La API está pensada para desarrolladores que manejan un proyecto en la nube, una cuenta de servicio y una consola de facturación. Si necesitas una locución para un video, un prototipo rápido o una narración puntual, esa configuración es una carga. PicassoIA aloja 24 modelos de texto a voz que puedes probar directamente desde el navegador, sin ningún proyecto en la nube que configurar.
Alternativas que vale la pena probar
| Modelo | Fortaleza | Buena opción para |
|---|
| Gemini 3.1 Flash TTS | 30 voces, más de 70 códigos de idioma, etiquetas de emoción | Narración expresiva y guiones multilingües |
| ElevenLabs v3 | Locuciones naturales y con sonido humano | Narrativa y lecturas de personajes |
| MiniMax Speech 2.8 HD | Salida de calidad de estudio | Narración pulida para video |
| Inworld Realtime TTS 2 | Dirección de voz en lenguaje natural | Agentes conversacionales |
| Qwen3 TTS | Clona una voz o diseña una nueva | Voces de marca personalizadas |
| ElevenLabs Dubbing | Traduce videos a más de 90 idiomas | Localizar material ya grabado |

Si tu proyecto necesita una voz propia en lugar de una genérica, MiniMax Voice Cloning crea una voz personalizada a partir de una muestra corta, y evita los $60 por millón de caracteres que Google cobra por una voz personalizada instantánea.
Cómo usar Gemini 3.1 Flash TTS
Gemini 3.1 Flash TTS es una buena primera prueba porque sus nombres de voz coinciden con la línea Chirp 3 HD de Google. Aoede, Puck, Charon y Kore aparecen en ambas, lo que facilita las comparaciones lado a lado.
- Abre la página del modelo y pega tu guion en el campo de texto. El límite es de 4000 bytes por generación, así que divide los guiones más largos.
- Elige una voz entre las 30 opciones. La predeterminada es Kore, y Puck, Charon, Fenrir y Aoede son rápidas para probar primero.
- Define el código de idioma. El predeterminado es en-US, y la lista supera los 70 códigos, incluidos es-MX, fr-CA, pt-BR y ja-JP.
- Escribe un prompt de estilo en inglés sencillo, como "Di esto con un tono tranquilo y profesional" o "Habla con entusiasmo y energía".
- Añade etiquetas expresivas dentro del guion: [whispering], [laughing], [shouting], [sigh] o [extremely fast].
- Genera, escucha y descarga el archivo de audio. Cambia un ajuste a la vez para oír qué hace cada uno.
| Parámetro | Qué controla | Punto de partida |
|---|
| Voz | Personaje, edad y tono | Kore para narración neutra |
| Código de idioma | Acento y pronunciación | Ajústalo a la región de tu público |
| Prompt de estilo | Ritmo, emoción, forma de entregar | Una frase corta |
| Etiquetas de texto | Expresión a nivel de frase | Dos o tres por párrafo |
💡 Consejo: Usa las etiquetas con moderación. Un guion en el que cada línea es [whispering] o [shouting] suena agotador. Úsalas para el contraste, no como decoración.
Música y transcripción junto al habla
El habla rara vez llega sola. Un video necesita una base musical bajo la narración, y el contenido hablado necesita una transcripción para subtítulos, búsqueda y accesibilidad. Google vende la transcripción como producto aparte con su propio contador, así que un proyecto de voz puede acabar con dos líneas de facturación antes de añadir música.
En el terreno musical, Lyria 3 Pro crea canciones completas a partir de un prompt de texto, MiniMax Music 2.6 añade voces y letra, y Stable Audio 2.5 sirve para bases instrumentales que quedan discretas bajo una voz. Pide la música como le darías un encargo a un compositor: género, tempo, instrumentos y ambiente. "Guitarra acústica cálida, 90 BPM, sin prisas, sin voces" da una base que no competirá con la narración.

Para las transcripciones, GPT-4o Transcribe y Gemini 3 Pro convierten grabaciones en texto, algo útil para notas de reuniones, entrevistas y subtítulos de la narración que acabas de generar.

Un flujo sencillo funciona bien: escribe el guion, genera la voz, añade una base musical y luego transcribe la mezcla final para producir subtítulos y revisar la pronunciación de los nombres difíciles.
Crea tu primera locución hoy
Las tablas de precios solo dicen hasta cierto punto. La forma más rápida de decidir entre una API en la nube y una herramienta en el navegador es escuchar cómo leen ambas el mismo párrafo. Toma 100 palabras de tu propio proyecto, pásalas por la consola de Google y luego pégalas en Gemini 3.1 Flash TTS o MiniMax Speech 2.8 HD y compara el ritmo, la calidez y la pronunciación lado a lado.
Mientras estés ahí, prueba el resto de la plataforma. Añade una base musical con Lyria 3 Pro, subtitula el resultado con GPT-4o Transcribe y crea tus propias imágenes fotorrealistas para miniaturas y para las ilustraciones de tus artículos con PicassoIA. Experimenta con libertad, cambia una variable a la vez y quédate con la combinación que suene bien. Explora todos los modelos en picassoia.com/en/all-models.