Precios de la API Batch de Gemini: límites, nivel gratuito y tiempo de respuesta
La API Batch de Gemini cobra el 50% de la tarifa estándar a cambio de un plazo objetivo de respuesta de 24 horas. Este artículo recoge los precios por modelo, las normas del nivel gratuito, los límites de solicitudes y tokens por nivel, los tiempos de respuesta reales y un ejemplo de costos con código en Python.
Pagar precio completo por respuestas que nadie necesita en este momento es el desperdicio más habitual en los proyectos con Gemini. La API Batch de Gemini existe justo para esa situación: envías a Google un montón de solicitudes, te desentiendes y recoges los resultados más tarde al 50% del costo estándar. El inconveniente es el tiempo. El plazo objetivo de Google es de 24 horas, los trabajos caducan a las 48 horas y varios límites determinan cuánto puedes enviar de una vez.
Este artículo reúne las cifras en un solo lugar: precios por lote y modelo, lo que realmente permite el nivel gratuito, los topes de tamaño y de tokens por nivel, cuánto tardan los resultados y las llamadas exactas en Python para enviar un trabajo. Todas las cifras proceden de las páginas públicas de precios, lotes y límites de frecuencia de Google, revisadas en octubre de 2026, así que confírmalas antes de comprometer un presupuesto grande.
💡 Respuesta rápida: el lote cuesta la mitad, tiene un objetivo de 24 horas, acepta menos de 20 MB en línea o 2 GB por archivo y permite 100 trabajos simultáneos. El nivel gratuito indica que el lote es gratuito solo para dos modelos Flash-Lite.
Qué hace realmente la API Batch
Trabajos asíncronos a mitad de precio
Una llamada normal a Gemini es síncrona: envías un prompt, esperas unos segundos y pagas la tarifa interactiva. Un trabajo por lotes funciona como dejar una caja de sobres en un centro de clasificación de correo. Envías muchas solicitudes como un solo trabajo, Google lo pone en cola, lo ejecuta cuando hay capacidad y guarda la salida lista para que la descargues. Los modelos, el formato del prompt y la configuración siguen igual. Solo cambia la entrega, y Google cobra el 50% del costo estándar a cambio.
El lote también admite más que prompts de texto:
Caché de contexto, facturada a las tarifas estándar de caché
Trabajos de embeddings mediante batches.create_embeddings
Generación de imágenes con la familia de modelos de imagen de Gemini Nano Banana
Salida estructurada con esquemas JSON
Búsqueda de Google como herramienta dentro de una solicitud
Dónde encaja mejor el lote
El lote compensa cuando nadie espera la respuesta. Encajan bien clasificar un catálogo de productos, resumir miles de tickets de soporte, etiquetar un conjunto de datos, ejecutar una batería de evaluación durante la noche, escribir textos alternativos para una biblioteca de imágenes o generar embeddings para un índice de búsqueda. También conviene a cualquier flujo que ya funcione con una programación, como una actualización nocturna de las descripciones de los productos que cambiaron ese día. No encajan los chatbots, la búsqueda en directo ni cualquier pantalla en la que una persona mira un indicador de carga.
💡 Regla práctica: si un retraso de seis horas no molestaría a nadie, el trabajo pertenece al lote.
Precios de la API Batch de Gemini por modelo
Todas las tarifas siguientes ya incluyen el descuento. Los precios están en dólares estadounidenses por 1 millón de tokens en el nivel de pago, tomados de la página de precios de Google en octubre de 2026.
Tarifas por millón de tokens
Modelo
Entrada en lote
Salida en lote
Gemini 3.8, 3.7 y 3.6 Flash (hasta el 31 de diciembre de 2026)
$0.375
$1.875
Gemini 3.8, 3.7 y 3.6 Flash (desde el 1 de enero de 2027)
Hay dos detalles importantes. Primero, las tarifas de lote de Gemini 3.8, 3.7 y 3.6 Flash son promocionales hasta el 31 de diciembre de 2026 y se duplican el 1 de enero de 2027, así que un presupuesto escrito ahora necesita ambas filas. Segundo, Gemini 2.5 Pro es el único modelo de la tabla en el que la longitud del prompt cambia el precio unitario.
Un ejemplo de costo calculado
Tomemos un trabajo de 10,000 solicitudes, cada una con 1,500 tokens de entrada y 300 tokens de salida. Eso suma 15 millones de tokens de entrada y 3 millones de tokens de salida.
El descuento es exactamente la mitad, así que la ejecución con Flash-Lite ahorra $6.00 y la de Flash ahorra $24.75. Con 1,000,000 de solicitudes, los mismos trabajos ahorran $600 y $2,475. Si tus prompts provocan un razonamiento largo, recuerda que los tokens de pensamiento se facturan como salida, así que la columna de salida puede crecer más rápido que la de entrada.
No adivines los conteos de tokens. Ejecuta primero 50 solicitudes representativas por la API normal, lee los metadatos de uso de cada respuesta y calcula el promedio de las cifras de entrada y salida. Multiplica por tu número de solicitudes y por la tarifa de lote. Una muestra de 50 tarda unos minutos y suele revelar la forma de prompt que tarda tres veces más que el resto.
Costos de generación de imágenes
La salida de imagen es la parte cara de los trabajos de imágenes. Gemini 3.1 Flash Image, el modelo conocido como Nano Banana 2, tiene tarifas de lote de $0.25 por millón de tokens de entrada de texto o imagen, $1.50 por millón de tokens de salida de texto y pensamiento, y $30.00 por millón de tokens de salida de imagen. Para unas pocas imágenes no necesitas un trabajo: Nano Banana 2 en PicassoIA genera imágenes sin límites de créditos, lo que lo convierte en un lugar más barato para probar un prompt antes de poner en cola 5,000 imágenes.
Nivel gratuito: qué obtienes realmente
Modelos con lote gratuito
La tabla de precios de Google tiene una fila de lote para cada modelo, con las columnas separadas Nivel gratuito y Nivel de pago. Al escribir esto, la columna del nivel gratuito dice gratuito para dos modelos: Gemini 3.5 Flash-Lite y Gemini 3.1 Flash-Lite. Dice no disponible para Gemini 3.8, 3.7, 3.6 y 3.5 Flash, Gemini 3.1 Flash Image, Gemini 2.5 Pro, Gemini 2.5 Flash y Gemini 2.5 Flash-Lite.
Dónde guardan silencio los documentos
La página de lotes no dice si las cuentas del nivel gratuito pueden enviar trabajos. La página de límites de frecuencia enumera los números de tokens en cola para los tres niveles de pago y ninguno para el nivel gratuito. Así que lee "gratuito" como con precio cero para esos dos modelos, no como ilimitado.
💡 Prueba antes de planificar: envía un trabajo de diez solicitudes con uno de los dos modelos Flash-Lite, observa su estado y revisa la página de límites de frecuencia de tu proyecto en AI Studio. No construyas un calendario de producción alrededor de una fila de lote gratuita hasta que ese trabajo pequeño tenga éxito.
Límites con los que te vas a topar
Los límites de lote se dividen en dos grupos: cuánto puede crecer un solo trabajo y cuánto trabajo puedes tener en espera a la vez.
Topes de tamaño de solicitudes y archivos
Límite
Valor
Carga útil de solicitud en línea
Menos de 20 MB en total
Tamaño de archivo de entrada
2 GB por archivo
Almacenamiento de archivos
20 GB
Solicitudes de lote simultáneas
100
Caducidad del trabajo
48 horas si está pendiente o en ejecución
Plazo objetivo de respuesta
24 horas
Las solicitudes en línea sirven para trabajos pequeños. Cuando la carga útil se acerque a 20 MB, cambia a un archivo JSONL: una solicitud por línea, cada línea con un ID de solicitud y el cuerpo de la solicitud, subido mediante la API de Files.
Tokens en cola por nivel
El límite más estricto no es el tamaño del archivo sino los tokens en cola: el total de tokens que esperan en todos los trabajos de lote activos de un mismo modelo. Crece con tu nivel de facturación.
Nivel
Cómo calificas
Tokens en cola (ejemplo)
Nivel 1
Cuenta de facturación vinculada
3,000,000 para Gemini 3.8 Flash
Nivel 2
$100 pagados y 3 días desde el primer pago exitoso
400,000,000 para Gemini 3.8 Flash
Nivel 3
$1,000 pagados y 30 días desde el primer pago exitoso
1,000,000,000 para la mayoría de los modelos
Para un modelo con un límite de 3,000,000 de tokens en el Nivel 1, nuestro ejemplo de 15 millones de tokens de entrada necesitaría al menos cinco oleadas separadas. En el Nivel 2 cabe en un solo trabajo y sobra margen. El salto del Nivel 1 al Nivel 2 es el que cambia la forma de diseñar un flujo.
Tiempo de respuesta y estados de los trabajos
Lo que realmente significan 24 horas
Google llama a las 24 horas el plazo objetivo de respuesta y añade que, en la mayoría de los casos, los resultados llegan mucho antes. Trátalo como un techo para planificar, no como una velocidad con la que puedas contar. Los trabajos pequeños suelen devolver resultados pronto, mientras que los grandes esperan capacidad.
El límite firme son 48 horas: un trabajo que siga pendiente o en ejecución en ese momento caduca. Dividir una carga grande en varios trabajos significa que una caducidad o un fallo te cuesta una porción en lugar de toda la ejecución.
Una trampa más: enviar un trabajo de lote no es idempotente. Si tu script agota el tiempo de espera tras la llamada de creación y reintentas, creas un segundo trabajo y pagas por ambos. Guarda el nombre del trabajo de la primera respuesta antes de hacer cualquier otra cosa.
Un ritmo práctico es la ejecución nocturna. Envía el trabajo al final de la jornada, déjalo correr durante la noche y lee los resultados con el primer café. Si un trabajo sigue pendiente después de un día completo, no esperes a la caducidad de 48 horas para enterarte: revisa su estado, mira tu total de tokens en cola para ese modelo y considera cancelarlo y volver a enviarlo en porciones más pequeñas.
Estados de los trabajos a vigilar
Como en una tanda de panadería, un trabajo pasa por etapas, y solo recoges la salida al final.
Estado
Qué significa
JOB_STATE_PENDING
En cola, aún sin empezar
JOB_STATE_RUNNING
Las solicitudes se están procesando
JOB_STATE_SUCCEEDED
Los resultados están listos para leer
JOB_STATE_FAILED
El trabajo falló, revisa su campo de error
JOB_STATE_CANCELLED
El trabajo fue cancelado
JOB_STATE_EXPIRED
El trabajo superó la ventana de 48 horas
El código de ejemplo de Google consulta el estado cada 30 segundos. Para trabajos que se espera que duren horas, un intervalo más lento evita llamadas inútiles.
Envía un trabajo por lotes en Python
Solicitudes en línea
Con el SDK de google-genai, un trabajo en línea recibe una lista de solicitudes, un nombre de modelo y un nombre para mostrar opcional:
from google import genai
client = genai.Client()
inline_requests = [
{"contents": [{"parts": [{"text": "Tell me a one-sentence joke."}], "role": "user"}]},
{"contents": [{"parts": [{"text": "Why is the sky blue?"}], "role": "user"}]},
]
job = client.batches.create(
model="gemini-3.8-flash",
src=inline_requests,
config={"display_name": "inlined-requests-job-1"},
)
print(job.name)
Para un trabajo con archivo, sube el JSONL con client.files.upload, usando mime_type='jsonl', y luego pasa uploaded_file.name como src.
Consulta y lee los resultados
import time
finished_states = {
"JOB_STATE_SUCCEEDED",
"JOB_STATE_FAILED",
"JOB_STATE_CANCELLED",
"JOB_STATE_EXPIRED",
}
job = client.batches.get(name=job.name)
while job.state.name not in finished_states:
time.sleep(30)
job = client.batches.get(name=job.name)
if job.state.name == "JOB_STATE_SUCCEEDED":
for i, item in enumerate(job.dest.inlined_responses):
if item.response:
print(i, item.response.text)
elif item.error:
print(i, item.error)
Los trabajos con archivo devuelven un archivo de resultados: lee job.dest.file_name y descárgalo con client.files.download.
Prueba los prompts antes de enviarlos en lote
Un trabajo por lotes es una retroalimentación lenta. Un prompt malo te cuesta una ventana de respuesta completa y una factura completa. Prueba primero el prompt de forma interactiva, con una docena de muestras variadas, y solo entonces pon en cola los miles.
Usa Gemini 3.5 Flash en PicassoIA
Gemini 3.5 Flash en PicassoIA ejecuta prompts individuales en tu navegador, lo que lo convierte en un banco de pruebas rápido. No envía trabajos de la API Batch: esos siguen pasando por el SDK de Google. Así es la rutina:
Abre la página del modelo y localiza el campo Prompt.
Pega el prompt exacto que planeas enviar en el lote, incluidos los ejemplos.
Añade una instrucción de sistema que defina el rol y el formato de salida, como "Devuelve un objeto JSON por producto".
Elige un nivel de pensamiento: ninguno, bajo o alto. Los niveles más altos cuestan más tokens de salida en tu lote real, así que usa el más bajo que funcione.
Baja la temperatura para extracción o clasificación. El valor predeterminado es 1 en una escala de 0 a 2.
Adjunta medios si el trabajo los necesita. El modelo acepta hasta 10 imágenes de 7 MB cada una, audio de hasta 8.4 horas y video de hasta 45 minutos.
Ejecuta diez muestras variadas y lee cada respuesta. Corrige el prompt y vuelve a ejecutarlas.
Copia el prompt final y la instrucción de sistema en tus solicitudes de lote.
El límite de salida predeterminado es de 65,535 tokens, así que define un tope más bajo en tareas cortas. En un lote, cada token no generado es dinero que te ahorras.
¿Quieres una segunda opinión sobre la calidad? Gemini 3.1 Pro, Gemini 3 Flash y Gemini 2.5 Flash están en la misma colección de modelos de lenguaje grandes, así que puedes probar un mismo prompt con todos antes de elegir qué modelo entra en el trabajo.
Gasta menos y luego crea imágenes
Tres formas de reducir la factura
Guarda en caché la parte compartida. La caché de contexto funciona dentro de los trabajos por lotes a las tarifas estándar de caché, así que un prompt de sistema largo repetido en 10,000 solicitudes no debería pagarse 10,000 veces.
Elige el modelo más pequeño que funcione. La entrada de Gemini 3.5 Flash-Lite cuesta $0.15 por millón de tokens frente a $0.75 de Gemini 3.5 Flash, cinco veces menos, y su tarifa de salida de $1.25 equivale a cerca del 28% de $4.50.
Limita la salida. Respuestas cortas, un nivel de pensamiento bajo y un límite de salida ajustado reducen la columna más cara de tu factura.
Evita por completo el lote cuando hay una persona esperando, cuando los resultados alimentan una pantalla en directo o cuando el trabajo es tan pequeño que el costo de consultar el estado supera el descuento.
El mismo hábito de probar barato antes de gastar a lo grande se aplica a las imágenes. Si tu trabajo por lotes alimenta un blog, un catálogo o una app, probablemente quieras imágenes que acompañen el texto. Abre Nano Banana 2 en PicassoIA y genera imágenes sin ningún contador de créditos en marcha, prueba Seedream 5 Pro o FLUX 2 Pro para un aspecto distinto e itera hasta que el resultado sea el correcto. Explora todas las opciones en picassoia.com/en/all-models y crea tu primera imagen hoy.