Gemini TTS: voces, precios, API e idiomas explicados

Gemini TTS convierte un guion en voz con 30 voces predefinidas, más de 70 idiomas y etiquetas expresivas como susurrar y reír. Este artículo desglosa cada voz por tono, el cálculo real de tokens detrás del precio, una llamada a la API en Python que funciona y una ruta en el navegador que no necesita configuración.

Gemini TTS: voces, precios, API e idiomas explicados
Cristian Da Conceicao
Fundador de Picasso IA

Una locución de un minuto con Gemini TTS cuesta unos tres centavos a la tarifa estándar. Ese único número explica por qué desarrolladores, podcasters y creadores de cursos no dejan de preguntar por él. Los modelos de voz de Google convierten un guion en audio con 30 voces con nombre, decenas de idiomas y una forma sencilla, en lenguaje natural, de dirigir la interpretación. Lo que no muestran los clips de demostración es todo lo que decide si encaja en tu proyecto: qué voz sirve para cada trabajo, cómo se suma la factura de tokens, cómo es la llamada a la API y dónde están los límites. A continuación encontrarás cada uno de esos puntos con cifras reales, un ejemplo en Python que funciona y una ruta sin código que puedes probar en tu navegador en menos de un minuto.

Qué hace realmente Gemini TTS

Gemini TTS es la parte de salida de voz de los modelos Gemini de Google. Envías texto más una instrucción opcional, y el modelo devuelve audio en lugar de más texto. Los motores clásicos de texto a voz aplican la misma entrega fija a cada frase. Un modelo Gemini TTS lee la instrucción y el guion juntos, así que "di esto como una enfermera cansada de turno de noche" cambia el ritmo, la respiración y el tono, no solo la altura de la voz.

Un presentador de podcast con sudadera gris hablando frente a un micrófono de brazo en un estudio casero cálido

Del texto al audio hablado

Cada solicitud tiene los mismos tres ingredientes: un guion, una voz y una instrucción de estilo. La página de Gemini 3.1 Flash TTS en Picasso IA los muestra como cuatro campos: text, voice, prompt y language_code. Los valores predeterminados son la voz Kore, el idioma en-US y el prompt "Say the following." Pulsas generar y en segundos llega un archivo de audio terminado. Las dos muestras publicadas en la página del modelo tardaron unos 6,5 y 4,0 segundos. Un ciclo tan corto cambia la forma de trabajar: reescribes una línea, la vuelves a generar y comparas las tomas como lo harías con un narrador humano, sin el costo de la reserva ni las horas de estudio.

Versiones del modelo en uso

Google publica más de un modelo TTS, y la elección cambia tu factura:

  • Gemini 3.1 Flash TTS (preview): con un precio de $1.00 por millón de tokens de texto de entrada y $20.00 por millón de tokens de audio de salida.
  • Gemini 2.5 Flash Preview TTS: exactamente la mitad del precio de 3.1 Flash en ambos sentidos.
  • Gemini 2.5 Pro Preview TTS: las mismas tarifas que 3.1 Flash, sin nivel gratuito.

¿Cuál elegir? Escoge 3.1 Flash cuando quieras el control de interpretación más reciente. Escoge 2.5 Flash cuando pongas voz a miles de textos cortos, como las notificaciones de una app, donde el ahorro de la mitad del precio se acumula rápido. Escoge 2.5 Pro solo si prefieres su resultado, ya que cuesta lo mismo que 3.1 Flash y no tiene nivel gratuito.

La documentación de voz de Google también enumera modelos TTS más nuevos de Flash y Flash Lite. Sus tarifas no aparecían en la tabla de precios cuando se escribió este artículo, así que consulta la tabla antes de presupuestar con ellos.

Las 30 voces, ordenadas por tono

Gemini TTS incluye 30 voces predefinidas con nombres tomados de la astronomía y la mitología. Google asigna a cada una una etiqueta de una sola palabra, como "Bright" o "Firm", y esas etiquetas son el atajo más rápido para elegir. Tómalas como punto de partida, porque una instrucción de estilo puede hacer cualquier voz más cálida, más rápida o más plana.

Primer plano cenital de las manos de un ingeniero de sonido sobre una mesa de mezclas con reguladores de aluminio cepillado

Brillantes y animadas

Siete voces tienen un perfil enérgico: Zephyr (Bright), Puck (Upbeat), Autonoe (Bright), Laomedeia (Upbeat), Sadachbia (Lively), Fenrir (Excitable) y Leda (Youthful). Úsalas en anuncios, clips para redes sociales, tours de incorporación y contenido infantil, en cualquier contexto en el que el oyente deba sentir impulso desde el primer segundo.

Cálidas y suaves

Seis voces tienen un registro más suave: Sulafat (Warm), Achird (Friendly), Vindemiatrix (Gentle), Achernar (Soft), Enceladus (Breathy) y Aoede (Breezy). Encajan en guiones de meditación, cuentos para dormir, apps de bienestar y mensajes de atención al cliente.

Firmes y claras

Diez voces transmiten autoridad: Kore (Firm), Orus (Firm), Alnilam (Firm), Iapetus (Clear), Erinome (Clear), Charon (Informative), Rasalgethi (Informative), Sadaltager (Knowledgeable), Schedar (Even) y Pulcherrima (Forward). Kore es la predeterminada por algo: funciona en tutoriales, explicaciones y demos de producto sin sonar rígida.

Las siete restantes cubren los huecos. Algieba, Despina, Callirrhoe, Umbriel y Zubenelgenubi son suaves, relajadas o informales, lo que encaja con la conversación. Algenib (Gravelly) y Gacrux (Mature) aportan textura para personajes y narraciones.

TrabajoVoces para probar primero
Demo de productoKore, Charon, Sadaltager
Intro de podcastPuck, Fenrir, Algenib
MeditaciónVindemiatrix, Achernar, Enceladus
Anuncio en redesZephyr, Sadachbia, Leda
Narración de audiolibroGacrux, Schedar, Sulafat

💡 Prueba antes de decidir. Pega un párrafo de 30 palabras, genéralo con tres voces y escúchalo en los altavoces que usará tu audiencia. Las etiquetas son la descripción de Google. Tus oídos tienen la última palabra.

Más de 70 idiomas y acentos

El campo de idioma acepta más de 70 idiomas, y muchos vienen en variantes regionales. Esto importa más de lo que parece: el español de México y el de Castilla difieren en vocabulario y ritmo, y el oyente lo nota en una frase.

Cinco compañeros alrededor de una mesa de roble en una oficina de traducción luminosa comparando guiones en distintos idiomas

IdiomaCódigos disponibles
Inglésen-US, en-GB, en-AU, en-IN
Españoles-ES, es-MX, es-419
Francésfr-FR, fr-CA
Portuguéspt-BR, pt-PT
Chinocmn-CN, cmn-tw
Árabear-001, ar-EG

El flujo de trabajo es sencillo. Escribe el guion en el idioma de destino, indica el código correspondiente y mantén la voz. En la mayoría de los casos, una sola voz puede leer todos los idiomas de la lista, así que mantienes un mismo sonido de marca en todos los mercados. Otros códigos populares son de-DE, it-IT, ja-JP, ko-KR, hi-IN, tr-TR, pl-PL, nl-NL, sv-SE y vi-VN.

Idiomas menos comunes de la lista

Más allá de los grandes mercados, la lista llega a cebuano (ceb-PH), criollo haitiano (ht-HT), javanés (jv-JV), malgache (mg-MG), maithili (mai-IN), konkani (kok-IN), sindhi (sd-IN), euskera (eu-ES), gallego (gl-ES) e incluso latín (la-VA). La calidad no será idéntica en todos, así que pide a un hablante nativo que revise cualquier contenido orientado al cliente. Antes de localizar un curso completo, genera una muestra de 20 segundos en el idioma de destino con dos voces y envíala a un hablante nativo con tres preguntas: ¿suenan bien los nombres?, ¿el ritmo resulta natural? y ¿el acento coincide con la región a la que te diriges? Si las siglas confunden al modelo, escríbelas fonéticamente en el guion. Si tu material de origen es un video terminado y no un guion, ElevenLabs Dubbing lo traduce a más de 90 idiomas en la misma plataforma.

Etiquetas e instrucciones de estilo

Dos palancas dan forma a la interpretación. Las etiquetas actúan sobre frases concretas, y la instrucción de estilo fija el ánimo de toda la toma.

Primer plano de un actor susurrando frente a un filtro antipop en una cabina de voz con un guion anotado

Etiquetas en línea para frases concretas

Las etiquetas van entre corchetes dentro del guion. La página del modelo enumera [sigh], [laughing], [whispering], [shouting] y [extremely fast], y las muestras publicadas demuestran que también funcionan las etiquetas descriptivas. Una muestra empieza con [like dracula] con la voz Algenib. Otra usa [laughs] I did NOT expect that. [sigh] Can you believe it! con Callirrhoe.

EtiquetaQué esperar
[whispering]Voz baja, cerca del micrófono
[laughing]Una risa audible antes o dentro de la frase
[shouting]Volumen alto y urgencia
[sigh]Un suspiro cansado o de alivio
[extremely fast]Un ritmo rápido y comprimido

Instrucciones de estilo para tomas completas

El campo prompt acepta lenguaje natural de hasta 4.000 bytes. Instrucciones breves como "Di esto con un tono tranquilo y profesional" o "Habla con entusiasmo y energía" ya cambian el resultado. Las más largas construyen una escena: "Estás teniendo una conversación informal con un amigo. Di lo siguiente de forma amable y divertida." Esa segunda forma es la que usa la muestra publicada de Callirrhoe.

Así combinan las dos palancas en un anuncio de producto, con voz de Puck. La instrucción dice "Habla como un presentador amable de un programa matinal, animado pero sin prisas." El guion dice Big news today. [whispering] We're launching the new dashboard tomorrow. [shouting] And it's free for every team! La instrucción marca el techo de energía, el susurro crea un momento de intimidad y el grito golpea con más fuerza porque sigue a una frase tranquila. El contraste es lo que hace audibles las etiquetas.

💡 Una emoción por frase. Apilar tres etiquetas en una línea produce un revoltijo. Coloca una etiqueta, escucha y decide después si la línea necesita otra.

Lo que cuesta realmente Gemini TTS

El audio se factura en tokens, y la página de precios de Google detalla la conversión: 25 tokens de audio por segundo. Todo lo demás sale de esa cifra.

Un creador freelance calculando un presupuesto en una libreta junto a un equipo portátil y una calculadora solar

ModeloTexto de entrada por 1M de tokensAudio de salida por 1M de tokensNivel gratuito
Gemini 3.1 Flash TTS Preview$1.00$20.00Sí
Gemini 2.5 Flash Preview TTS$0.50$10.00Sí
Gemini 2.5 Pro Preview TTS$1.00$20.00No

El cálculo de tokens con números sencillos

Un minuto de habla son 60 segundos por 25 tokens, es decir, 1.500 tokens de salida. A $20.00 por millón, eso equivale a 1.500 por 20 dividido entre 1.000.000, o $0.03 por minuto. El texto que envías apenas cuenta: 150 palabras habladas son unos 200 tokens de entrada, unos $0.0002.

Duración del audio3.1 Flash estándar3.1 Flash por lotes2.5 Flash estándar
1 minuto$0.03$0.015$0.015
10 minutos$0.30$0.15$0.15
1 hora$1.80$0.90$0.90
10 horas$18.00$9.00$9.00

Nivel gratuito y descuentos por lotes

Google ofrece un nivel gratuito para ambos modelos Flash, mientras que Pro es solo de pago. Los límites de uso de los niveles gratuitos cambian, así que confírmalos en la página de precios antes de construir un plan de lanzamiento sobre ellos. El modo por lotes, es decir, trabajos asíncronos que terminan más tarde, reduce ambas tarifas a la mitad. Eso lo convierte en la opción obvia para audiolibros, bibliotecas de cursos o cualquier catálogo atrasado que puedas generar durante la noche.

Un ejemplo trabajado lo hace concreto. Supón que pones voz a un curso de 20 lecciones de 8 minutos cada una. Son 160 minutos de audio, que cuestan 160 por $0.03, o $4.80, a la tarifa estándar de 3.1 Flash, y $2.40 por lotes. Si subes a 100 lecciones, llegas a $24.00 estándar o $12.00 por lotes. Volver a grabar una lección tras un cambio en el guion cuesta unos 24 centavos, que es la verdadera ventaja: editar el audio deja de ser un problema de agenda.

💡 Regla práctica de presupuesto. Multiplica tus minutos de audio terminados por $0.03 para la tarifa estándar de 3.1 Flash. La mitad de eso para lotes. Estas tarifas provienen de modelos en preview, así que revísalas cuando escales.

Cómo llamar a la API de Gemini TTS

Con el SDK de Python, una solicitud TTS es una llamada generate_content normal con dos cambios: una modalidad de respuesta de audio y una configuración de voz que indica la voz.

Vista por encima del hombro de un desarrollador escribiendo junto a un monitor con un editor de código oscuro

Un ejemplo mínimo en Python

from google import genai
from google.genai import types
import wave

client = genai.Client()  # reads your credentials from the environment

response = client.models.generate_content(
    model="gemini-3.1-flash-tts-preview",
    contents="Say warmly: Welcome back. Today we compare three voices.",
    config=types.GenerateContentConfig(
        response_modalities=["AUDIO"],
        speech_config=types.SpeechConfig(
            voice_config=types.VoiceConfig(
                prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Kore")
            )
        ),
    ),
)

pcm = response.candidates[0].content.parts[0].inline_data.data

with wave.open("welcome.wav", "wb") as f:
    f.setnchannels(1)
    f.setsampwidth(2)
    f.setframerate(24000)
    f.writeframes(pcm)

Algunos detalles ahorran tiempo de depuración:

  • Las credenciales quedan fuera del archivo. El cliente las toma de una variable de entorno, así que nada secreto queda en tu repositorio.
  • La instrucción de estilo forma parte del texto del prompt. "Say warmly:" antes del guion cumple la misma función que el campo prompt de Picasso IA.
  • La salida es PCM sin procesar. Llega como audio de 24 kHz, mono, 16 bits. El módulo wave lo envuelve en un archivo WAV reproducible, y ffmpeg lo convierte a MP3 si necesitas archivos más pequeños.
  • Los nombres de los campos cambian en los modelos en preview. Revisa la referencia actual de Google si una llamada falla después de actualizar el SDK.

Dos hablantes en una sola llamada

La API admite hasta dos hablantes en una sola solicitud. Etiqueta las líneas de tu guion, por ejemplo "Host:" y "Guest:", y luego asigna cada etiqueta a una voz en la configuración de voz. Es una vía rápida para diálogos al estilo podcast o para una FAQ con dos voces. Combina una voz firme con una animada para que el oyente distinga los turnos sin ver nada. Para tres o más voces, genera las líneas de cada hablante por separado y únelas en un editor de audio.

En guiones largos, divide por párrafo, envía los fragmentos uno a uno y guarda en caché cada resultado. Así, una solicitud fallida te cuesta un párrafo, no el capítulo entero. Los modelos en preview suelen tener límites de uso más estrictos que los estables, así que envuelve las llamadas en un reintento con retroceso exponencial. Registra la voz, el código de idioma y un hash del guion junto a cada archivo, y podrás regenerar cualquier clip más adelante con la misma configuración.

Prueba Gemini TTS en tu navegador

Si solo necesitas unos cuantos clips, omite el código. La página del modelo en Picasso IA presenta Gemini 3.1 Flash TTS como una opción que puedes probar gratis en línea, sin configuración, y cada campo corresponde a las opciones de la API que vimos antes.

Una creadora de contenido escribiendo un guion en un equipo portátil en un espacio de trabajo luminoso con auriculares alrededor del cuello

Paso a paso en el navegador

  1. Abre la página de Gemini 3.1 Flash TTS en Picasso IA.
  2. Pega tu guion en Text. El límite es de 4.000 bytes, suficiente para una explicación breve. Cuenta bytes, no caracteres, así que los guiones en japonés o árabe caben en menos caracteres que los del inglés.
  3. Elige una Voice. Empieza con Kore y luego prueba otras dos.
  4. Define el Language code que coincida con tu guion, como es-MX para el español de México.
  5. Escribe un Prompt que describa el tono y el ritmo, o deja el predeterminado "Say the following." para una lectura neutral.
  6. Añade etiquetas como [whispering] donde quieras emoción, pulsa generar y descarga el audio.
  7. Para piezas más largas, divide el guion por secciones y une los archivos después.

Ajustes que vale la pena cambiar

CampoPredeterminadoConsejo
TextNingunoHasta 4.000 bytes. Usa etiquetas con moderación
VoiceKore30 opciones. Prueba tres antes de elegir
PromptSay the following.Hasta 4.000 bytes. Define tono, ritmo y acento
Language codeen-USDebe coincidir con el idioma en que está escrito el guion

💡 Una toma plana suele significar un prompt corto. Alarga el prompt, no el guion. Di quién habla, a quién y por qué, y el ritmo y el énfasis tienden a seguir.

Combínalo con música y transcripciones

La voz rara vez es todo el proyecto. Para una base musical de fondo, prueba Lyria 3 o Music 2.6 y mézclala suavemente bajo la narración. Para los subtítulos, pasa el audio por Gemini 3 Pro o GPT 4o Transcribe.

Una periodista con gafas redondas transcribiendo una entrevista en una mesa de cafetería con un equipo portátil y una grabadora

La transcripción también sirve como control de calidad. Transcribe la narración generada y compárala con el guion. Los nombres de productos mal pronunciados y las palabras omitidas aparecen como diferencias de texto mucho antes de que un oyente se queje.

Haz tu primera locución

Gemini TTS se gana su lugar en un puñado de trabajos: narración de demos de producto, intros de podcast y lecturas publicitarias, versiones de audio de artículos y boletines, videos de formación con un tono coherente y pistas multilingües creadas a partir de un solo guion. Si tu proyecto necesita otro sonido, tres modelos más de la misma categoría merecen una prueba: MiniMax Speech 2.8 HD para locuciones de calidad de estudio, ElevenLabs V3 para narraciones naturales e Inworld Realtime TTS 2 cuando la velocidad de respuesta es lo más importante. Otro límite que conviene conocer: tanto la API como la página de Picasso IA trabajan con las 30 voces predefinidas. Si necesitas una voz que suene como tú o como tu marca, prueba MiniMax Voice Cloning o Qwen3 TTS en su lugar.

Una mujer con un cárdigan mostaza escuchando un audiolibro junto a una ventana lluviosa con rincón de lectura

La forma más rápida de resolver la cuestión de la voz es escucharla. Toma un párrafo de tu propio proyecto, abre Gemini 3.1 Flash TTS en Picasso IA y genéralo con tres voces. Añade una etiqueta [whispering], cambia el código de idioma para ver cómo suena tu guion en un segundo mercado y compara los clips lado a lado. En diez minutos sabrás cuál es tu voz, y podrás probar el mismo flujo de trabajo con modelos de música y transcripción en Picasso IA cuando el proyecto crezca.

Compartir este artículo

Elige tu idioma