Tarifs de l’API Batch de Gemini : limites, offre gratuite et délai de réponse
L’API Batch de Gemini facture 50 % du tarif standard en échange d’un délai cible de 24 heures. Cet article détaille les prix par modèle, les règles de l’offre gratuite, les limites de requêtes et de tokens par palier, les délais de réponse réels et un exemple de coût chiffré avec du code Python.
Payer plein tarif pour des réponses dont personne n’a besoin dans l’immédiat est le gaspillage le plus courant dans les projets Gemini. L’API Batch de Gemini existe précisément pour cette situation : vous confiez à Google un lot de requêtes, vous vous éloignez, et vous récupérez les résultats plus tard à 50 % du coût standard. Le revers de la médaille, c’est le temps. Le délai cible de Google est de 24 heures, les tâches expirent au bout de 48 heures, et quelques limites déterminent la taille du lot que vous pouvez envoyer.
Cet article rassemble les chiffres en un seul endroit : les prix batch par modèle, ce que l’offre gratuite permet réellement, les plafonds de taille et de tokens par palier, les délais de réponse et les appels Python exacts pour soumettre une tâche. Tous les chiffres proviennent des pages publiques de Google sur les tarifs, le batch et les limites de débit, telles que vérifiées en octobre 2026. Vérifiez-les donc avant d’engager un budget important.
💡 Réponse rapide : le batch coûte moitié moins cher, vise 24 heures, accepte moins de 20 Mo en ligne ou 2 Go par fichier, et autorise 100 tâches simultanées. L’offre gratuite n’indique le batch comme gratuit que pour deux modèles Flash-Lite.
Ce que fait réellement l’API Batch
Tâches asynchrones à moitié prix
Un appel Gemini normal est synchrone : vous envoyez un prompt, attendez quelques secondes et payez le tarif interactif. Une tâche batch fonctionne comme le dépôt d’un carton d’enveloppes dans un centre de tri. Vous soumettez de nombreuses requêtes sous forme d’une seule tâche, Google la met en file d’attente, l’exécute quand la capacité le permet et conserve le résultat prêt à être téléchargé. Les modèles, le format des prompts et les paramètres restent les mêmes. Seule la livraison change, et Google facture 50 % du coût standard pour cet échange.
Le batch prend aussi en charge plus que des prompts en texte brut :
Mise en cache du contexte, facturée aux tarifs de cache standard
Tâches d’embeddings via batches.create_embeddings
Génération d’images avec la famille de modèles d’image Gemini Nano Banana
Sortie structurée avec des schémas JSON
Google Search comme outil dans une requête
Où le batch convient le mieux
Le batch est rentable quand personne n’attend la réponse. Les usages adaptés sont la classification d’un catalogue de produits, le résumé de milliers de tickets de support, l’étiquetage d’un jeu de données, l’exécution d’une suite d’évaluation pendant la nuit, la rédaction de textes alternatifs pour une bibliothèque d’images, ou la production d’embeddings pour un index de recherche. Il convient aussi à tout pipeline déjà planifié, comme une mise à jour nocturne des descriptions de produits modifiés dans la journée. Les mauvais usages sont les chatbots, la recherche en temps réel et tout écran où une personne regarde un indicateur de chargement.
💡 Règle générale : si un retard de six heures ne dérangerait personne, la tâche relève du batch.
Tarifs de l’API Batch de Gemini par modèle
Chaque tarif ci-dessous est déjà réduit. Les prix sont exprimés en dollars américains pour 1 million de tokens sur le palier payant, d’après la page tarifaire de Google en octobre 2026.
Tarifs par million de tokens
Modèle
Entrée batch
Sortie batch
Gemini 3.8, 3.7 et 3.6 Flash (jusqu’au 31 décembre 2026)
0,375 $
1,875 $
Gemini 3.8, 3.7 et 3.6 Flash (à partir du 1er janvier 2027)
Deux points comptent ici. D’abord, les tarifs batch de Gemini 3.8, 3.7 et 3.6 Flash sont promotionnels jusqu’au 31 décembre 2026 et doublent le 1er janvier 2027, donc un budget établi maintenant doit tenir compte des deux lignes. Ensuite, Gemini 2.5 Pro est le seul modèle du tableau dont le prix unitaire change selon la longueur du prompt.
Un exemple de calcul de coût
Prenons une tâche de 10 000 requêtes, chacune avec 1 500 tokens d’entrée et 300 tokens de sortie. Cela fait 15 millions de tokens d’entrée et 3 millions de tokens de sortie.
La remise est exactement de moitié : l’exécution sur Flash-Lite économise donc $6,00 et celle sur Flash économise $24,75. Pour 1 000 000 de requêtes, les mêmes tâches économisent $600 et $2 475. Si vos prompts déclenchent un long raisonnement, rappelez-vous que les tokens de réflexion sont facturés en sortie, si bien que la colonne des sorties peut croître plus vite que celle des entrées.
Ne devinez pas les nombres de tokens. Exécutez d’abord 50 requêtes représentatives via l’API normale, lisez les métadonnées d’utilisation de chaque réponse, puis faites la moyenne des chiffres d’entrée et de sortie. Multipliez par votre nombre de requêtes et par le tarif batch. Un échantillon de 50 requêtes prend quelques minutes et révèle souvent la forme de prompt qui tourne trois fois plus longtemps que les autres.
Coûts de génération d’images
La sortie image est la partie coûteuse des tâches d’images. Gemini 3.1 Flash Image, le modèle connu sous le nom de Nano Banana 2, affiche des tarifs batch de $0,25 par million de tokens d’entrée texte ou image, $1,50 par million de tokens de sortie texte et réflexion, et $30,00 par million de tokens de sortie image. Pour quelques images, vous n’avez pas besoin d’une tâche : Nano Banana 2 sur PicassoIA génère des images sans plafond de crédits, ce qui en fait un endroit moins coûteux pour tester un prompt avant d’en mettre 5 000 en file d’attente.
Offre gratuite : ce que vous obtenez réellement
Modèles avec batch gratuit
La grille tarifaire de Google comporte une ligne Batch pour chaque modèle, avec des colonnes séparées Offre gratuite et Offre payante. Au moment de la rédaction, la colonne Offre gratuite indique gratuit pour deux modèles : Gemini 3.5 Flash-Lite et Gemini 3.1 Flash-Lite. Elle indique non disponible pour Gemini 3.8, 3.7, 3.6 et 3.5 Flash, Gemini 3.1 Flash Image, Gemini 2.5 Pro, Gemini 2.5 Flash et Gemini 2.5 Flash-Lite.
Là où la documentation reste muette
La page batch ne précise pas si les comptes de l’offre gratuite peuvent soumettre des tâches. La page des limites de débit liste les nombres de tokens en file d’attente pour les trois paliers payants, et aucun pour l’offre gratuite. Lisez donc « gratuit » comme tarifé à zéro pour ces deux modèles, et non comme illimité.
💡 Testez avant de planifier : soumettez une tâche de dix requêtes sur l’un des deux modèles Flash-Lite, suivez son état et consultez la page des limites de débit de votre projet dans AI Studio. Ne bâtissez pas de calendrier de production autour d’une ligne batch gratuite tant que cette petite tâche n’a pas réussi.
Limites que vous rencontrerez
Les limites du batch se répartissent en deux groupes : la taille maximale d’une tâche unique, et la quantité de travail pouvant attendre en même temps.
Plafonds de taille des requêtes et des fichiers
Limite
Valeur
Charge utile des requêtes en ligne
Moins de 20 Mo au total
Taille de fichier d’entrée
2 Go par fichier
Stockage de fichiers
20 Go
Requêtes batch simultanées
100
Expiration de la tâche
48 heures si en attente ou en cours
Délai cible
24 heures
Les requêtes en ligne conviennent aux petites tâches. Dès que la charge utile approche 20 Mo, passez à un fichier JSONL : une requête par ligne, chaque ligne contenant un identifiant de requête et le corps de la requête, importé via l’API Files.
Tokens en file d’attente par palier
La limite la plus contraignante n’est pas la taille des fichiers mais les tokens en file d’attente : le total des tokens en attente sur l’ensemble des tâches batch actives pour un modèle. Elle évolue avec votre palier de facturation.
Palier
Comment vous qualifier
Tokens en file d’attente (exemple)
Palier 1
Compte de facturation lié
3 000 000 pour Gemini 3.8 Flash
Palier 2
$100 payés et 3 jours depuis le premier paiement réussi
400 000 000 pour Gemini 3.8 Flash
Palier 3
$1 000 payés et 30 jours depuis le premier paiement réussi
1 000 000 000 pour la plupart des modèles
Pour un modèle dont la limite du palier 1 est de 3 000 000 de tokens, notre exemple de 15 millions de tokens d’entrée nécessiterait au moins cinq vagues distinctes. Sur le palier 2, il tient dans une seule tâche avec de la marge. Le passage du palier 1 au palier 2 est celui qui change la façon dont vous concevez un pipeline.
Délai de réponse et états des tâches
Ce que signifient réellement 24 heures
Google appelle 24 heures le délai cible et ajoute que, dans la plupart des cas, les résultats arrivent bien plus vite. Considérez cela comme un plafond autour duquel vous planifiez, et non comme une vitesse sur laquelle vous pouvez compter. Les petites tâches reviennent souvent rapidement, tandis que les grandes attendent la capacité disponible.
La limite stricte est 48 heures : une tâche encore en attente ou en cours à ce moment-là expire. Découper une grosse charge de travail en plusieurs tâches signifie qu’une expiration ou un échec ne vous coûte qu’une tranche au lieu de l’ensemble de l’exécution.
Autre piège : soumettre une tâche batch n’est pas idempotent. Si votre script expire après l’appel de création et que vous relancez, vous créez une deuxième tâche et payez les deux. Enregistrez le nom de la tâche renvoyé par la première réponse avant toute autre action.
Un rythme pratique est l’exécution nocturne. Soumettez la tâche en fin de journée de travail, laissez-la tourner pendant la nuit, et lisez les résultats avec votre premier café. Si une tâche est encore en attente après une journée complète, n’attendez pas l’expiration à 48 heures pour le savoir : vérifiez son état, regardez votre total de tokens en file d’attente pour ce modèle, et envisagez d’annuler puis de resoumettre en tranches plus petites.
États des tâches à surveiller
Comme pour une fournée de boulangerie, une tâche passe par plusieurs étapes, et vous ne récupérez la sortie qu’à la fin.
État
Signification
JOB_STATE_PENDING
En file d’attente, pas encore démarrée
JOB_STATE_RUNNING
Les requêtes sont en cours de traitement
JOB_STATE_SUCCEEDED
Les résultats sont prêts à être lus
JOB_STATE_FAILED
La tâche a échoué, vérifiez son champ d’erreur
JOB_STATE_CANCELLED
La tâche a été annulée
JOB_STATE_EXPIRED
La tâche a dépassé la fenêtre de 48 heures
Le code d’exemple de Google interroge l’état toutes les 30 secondes. Pour les tâches qui doivent durer des heures, un intervalle plus long évite des appels inutiles.
Soumettre une tâche batch en Python
Requêtes en ligne
Avec le SDK google-genai, une tâche en ligne prend une liste de requêtes, un nom de modèle et un nom d’affichage facultatif :
from google import genai
client = genai.Client()
inline_requests = [
{"contents": [{"parts": [{"text": "Tell me a one-sentence joke."}], "role": "user"}]},
{"contents": [{"parts": [{"text": "Why is the sky blue?"}], "role": "user"}]},
]
job = client.batches.create(
model="gemini-3.8-flash",
src=inline_requests,
config={"display_name": "inlined-requests-job-1"},
)
print(job.name)
Pour une tâche par fichier, importez le JSONL avec client.files.upload, en utilisant mime_type='jsonl', puis passez uploaded_file.name comme src.
Interroger et lire les résultats
import time
finished_states = {
"JOB_STATE_SUCCEEDED",
"JOB_STATE_FAILED",
"JOB_STATE_CANCELLED",
"JOB_STATE_EXPIRED",
}
job = client.batches.get(name=job.name)
while job.state.name not in finished_states:
time.sleep(30)
job = client.batches.get(name=job.name)
if job.state.name == "JOB_STATE_SUCCEEDED":
for i, item in enumerate(job.dest.inlined_responses):
if item.response:
print(i, item.response.text)
elif item.error:
print(i, item.error)
Les tâches par fichier renvoient plutôt un fichier de résultats : lisez job.dest.file_name et récupérez-le avec client.files.download.
Tester les prompts avant le batch
Une tâche batch est un retour d’information lent. Un mauvais prompt vous coûte une fenêtre de délai complète et une facture complète. Testez d’abord le prompt de façon interactive, sur une douzaine d’exemples variés, puis seulement ensuite mettez en file d’attente les milliers de requêtes.
Utiliser Gemini 3.5 Flash sur PicassoIA
Gemini 3.5 Flash sur PicassoIA exécute des prompts uniques dans votre navigateur, ce qui en fait un banc d’essai rapide. Il ne soumet pas de tâches de l’API Batch, celles-ci passent toujours par le SDK de Google. Voici la marche à suivre :
Ouvrez la page du modèle et repérez le champ Prompt.
Collez le prompt exact que vous prévoyez d’envoyer dans le batch, y compris les exemples éventuels.
Ajoutez une instruction système qui définit le rôle et le format de sortie, par exemple « Renvoie un objet JSON par produit ».
Choisissez un niveau de réflexion : aucun, faible ou élevé. Les niveaux plus élevés coûtent davantage de tokens de sortie dans votre batch réel, utilisez donc le plus bas qui fonctionne.
Baissez la température pour l’extraction ou la classification. La valeur par défaut est 1 sur une échelle de 0 à 2.
Joignez les médias si la tâche en a besoin. Le modèle accepte jusqu’à 10 images de 7 Mo chacune, de l’audio jusqu’à 8,4 heures et de la vidéo jusqu’à 45 minutes.
Lancez dix exemples variés et lisez chaque réponse. Corrigez le prompt, puis relancez-les.
Copiez le prompt final et l’instruction système dans vos requêtes batch.
La limite de sortie par défaut est de 65 535 tokens, donc fixez un plafond plus bas pour les tâches courtes. Dans un batch, chaque token non généré est de l’argent que vous économisez.
Besoin d’un second avis sur la qualité ? Gemini 3.1 Pro, Gemini 3 Flash et Gemini 2.5 Flash se trouvent dans la même collection de grands modèles de langage, ce qui vous permet de tester un prompt sur chacun d’eux avant de choisir le modèle qui ira dans la tâche.
Dépenser moins, puis créer des images
Trois façons de réduire la facture
Mettez en cache la partie commune. La mise en cache du contexte fonctionne dans les tâches batch aux tarifs de cache standard, donc un long prompt système répété dans 10 000 requêtes ne devrait pas être payé 10 000 fois.
Choisissez le plus petit modèle qui convient. L’entrée de Gemini 3.5 Flash-Lite coûte $0,15 par million de tokens contre $0,75 pour Gemini 3.5 Flash, soit cinq fois moins, et son tarif de sortie de $1,25 représente environ 28 % de $4,50.
Plafonnez la sortie. Des réponses courtes, un niveau de réflexion faible et une limite de sortie serrée réduisent la colonne la plus coûteuse de votre facture.
Évitez le batch lorsqu’une personne attend, lorsque les résultats alimentent un écran en direct, ou lorsque la tâche est si petite que le coût de l’interrogation dépasse la remise.
La même habitude consistant à tester à bas coût avant de dépenser gros vaut pour les visuels. Si votre tâche batch alimente un blog, un catalogue ou une application, vous voudrez probablement des images pour accompagner le texte. Ouvrez Nano Banana 2 sur PicassoIA et générez des images sans compteur de crédits en cours, essayez Seedream 5 Pro ou FLUX 2 Pro pour un rendu différent, et itérez jusqu’à obtenir le bon résultat. Parcourez toutes les options sur picassoia.com/en/all-models et créez votre première image dès aujourd’hui.