Tarifs de l’API Batch de Gemini : limites, offre gratuite et délai de réponse

L’API Batch de Gemini facture 50 % du tarif standard en échange d’un délai cible de 24 heures. Cet article détaille les prix par modèle, les règles de l’offre gratuite, les limites de requêtes et de tokens par palier, les délais de réponse réels et un exemple de coût chiffré avec du code Python.

Tarifs de l’API Batch de Gemini : limites, offre gratuite et délai de réponse
Cristian Da Conceicao
Fondateur de Picasso IA

Payer plein tarif pour des réponses dont personne n’a besoin dans l’immédiat est le gaspillage le plus courant dans les projets Gemini. L’API Batch de Gemini existe précisément pour cette situation : vous confiez à Google un lot de requêtes, vous vous éloignez, et vous récupérez les résultats plus tard à 50 % du coût standard. Le revers de la médaille, c’est le temps. Le délai cible de Google est de 24 heures, les tâches expirent au bout de 48 heures, et quelques limites déterminent la taille du lot que vous pouvez envoyer.

Cet article rassemble les chiffres en un seul endroit : les prix batch par modèle, ce que l’offre gratuite permet réellement, les plafonds de taille et de tokens par palier, les délais de réponse et les appels Python exacts pour soumettre une tâche. Tous les chiffres proviennent des pages publiques de Google sur les tarifs, le batch et les limites de débit, telles que vérifiées en octobre 2026. Vérifiez-les donc avant d’engager un budget important.

💡 Réponse rapide : le batch coûte moitié moins cher, vise 24 heures, accepte moins de 20 Mo en ligne ou 2 Go par fichier, et autorise 100 tâches simultanées. L’offre gratuite n’indique le batch comme gratuit que pour deux modèles Flash-Lite.

Ce que fait réellement l’API Batch

Tâches asynchrones à moitié prix

Une longue table de tri en bois clair, bordée de rangées d’enveloppes crème identiques, vue de dessus

Un appel Gemini normal est synchrone : vous envoyez un prompt, attendez quelques secondes et payez le tarif interactif. Une tâche batch fonctionne comme le dépôt d’un carton d’enveloppes dans un centre de tri. Vous soumettez de nombreuses requêtes sous forme d’une seule tâche, Google la met en file d’attente, l’exécute quand la capacité le permet et conserve le résultat prêt à être téléchargé. Les modèles, le format des prompts et les paramètres restent les mêmes. Seule la livraison change, et Google facture 50 % du coût standard pour cet échange.

Le batch prend aussi en charge plus que des prompts en texte brut :

  • Mise en cache du contexte, facturée aux tarifs de cache standard
  • Tâches d’embeddings via batches.create_embeddings
  • Génération d’images avec la famille de modèles d’image Gemini Nano Banana
  • Sortie structurée avec des schémas JSON
  • Google Search comme outil dans une requête

Où le batch convient le mieux

Le batch est rentable quand personne n’attend la réponse. Les usages adaptés sont la classification d’un catalogue de produits, le résumé de milliers de tickets de support, l’étiquetage d’un jeu de données, l’exécution d’une suite d’évaluation pendant la nuit, la rédaction de textes alternatifs pour une bibliothèque d’images, ou la production d’embeddings pour un index de recherche. Il convient aussi à tout pipeline déjà planifié, comme une mise à jour nocturne des descriptions de produits modifiés dans la journée. Les mauvais usages sont les chatbots, la recherche en temps réel et tout écran où une personne regarde un indicateur de chargement.

💡 Règle générale : si un retard de six heures ne dérangerait personne, la tâche relève du batch.

Tarifs de l’API Batch de Gemini par modèle

Chaque tarif ci-dessous est déjà réduit. Les prix sont exprimés en dollars américains pour 1 million de tokens sur le palier payant, d’après la page tarifaire de Google en octobre 2026.

Tarifs par million de tokens

Gros plan d’une calculatrice noire et de tickets de caisse imprimés sur un bureau en noyer foncé

ModèleEntrée batchSortie batch
Gemini 3.8, 3.7 et 3.6 Flash (jusqu’au 31 décembre 2026)0,375 $1,875 $
Gemini 3.8, 3.7 et 3.6 Flash (à partir du 1er janvier 2027)0,75 $3,75 $
Gemini 3.5 Flash0,75 $4,50 $
Gemini 3.5 Flash-Lite0,15 $1,25 $
Gemini 3.1 Flash-Lite0,125 $ texte, image, vidéo ; 0,25 $ audio0,75 $
Gemini 2.5 Pro0,625 $ jusqu’à 200k tokens ; 1,25 $ au-delà5,00 $ jusqu’à 200k tokens ; 7,50 $ au-delà
Gemini 2.5 Flash0,15 $ texte, image, vidéo ; 0,50 $ audio1,25 $
Gemini 2.5 Flash-Lite0,05 $ texte, image, vidéo ; 0,15 $ audio0,20 $

Deux points comptent ici. D’abord, les tarifs batch de Gemini 3.8, 3.7 et 3.6 Flash sont promotionnels jusqu’au 31 décembre 2026 et doublent le 1er janvier 2027, donc un budget établi maintenant doit tenir compte des deux lignes. Ensuite, Gemini 2.5 Pro est le seul modèle du tableau dont le prix unitaire change selon la longueur du prompt.

Un exemple de calcul de coût

Prenons une tâche de 10 000 requêtes, chacune avec 1 500 tokens d’entrée et 300 tokens de sortie. Cela fait 15 millions de tokens d’entrée et 3 millions de tokens de sortie.

ModèleCoût d’entréeCoût de sortieTotal batchTotal standard
Gemini 3.5 Flash-Lite$2,25$3,75$6,00$12,00
Gemini 3.5 Flash$11,25$13,50$24,75$49,50

La remise est exactement de moitié : l’exécution sur Flash-Lite économise donc $6,00 et celle sur Flash économise $24,75. Pour 1 000 000 de requêtes, les mêmes tâches économisent $600 et $2 475. Si vos prompts déclenchent un long raisonnement, rappelez-vous que les tokens de réflexion sont facturés en sortie, si bien que la colonne des sorties peut croître plus vite que celle des entrées.

Ne devinez pas les nombres de tokens. Exécutez d’abord 50 requêtes représentatives via l’API normale, lisez les métadonnées d’utilisation de chaque réponse, puis faites la moyenne des chiffres d’entrée et de sortie. Multipliez par votre nombre de requêtes et par le tarif batch. Un échantillon de 50 requêtes prend quelques minutes et révèle souvent la forme de prompt qui tourne trois fois plus longtemps que les autres.

Coûts de génération d’images

La sortie image est la partie coûteuse des tâches d’images. Gemini 3.1 Flash Image, le modèle connu sous le nom de Nano Banana 2, affiche des tarifs batch de $0,25 par million de tokens d’entrée texte ou image, $1,50 par million de tokens de sortie texte et réflexion, et $30,00 par million de tokens de sortie image. Pour quelques images, vous n’avez pas besoin d’une tâche : Nano Banana 2 sur PicassoIA génère des images sans plafond de crédits, ce qui en fait un endroit moins coûteux pour tester un prompt avant d’en mettre 5 000 en file d’attente.

Offre gratuite : ce que vous obtenez réellement

Un jeune développeur en pull vert travaillant sur un ordinateur portable à une table de café

Modèles avec batch gratuit

La grille tarifaire de Google comporte une ligne Batch pour chaque modèle, avec des colonnes séparées Offre gratuite et Offre payante. Au moment de la rédaction, la colonne Offre gratuite indique gratuit pour deux modèles : Gemini 3.5 Flash-Lite et Gemini 3.1 Flash-Lite. Elle indique non disponible pour Gemini 3.8, 3.7, 3.6 et 3.5 Flash, Gemini 3.1 Flash Image, Gemini 2.5 Pro, Gemini 2.5 Flash et Gemini 2.5 Flash-Lite.

Là où la documentation reste muette

La page batch ne précise pas si les comptes de l’offre gratuite peuvent soumettre des tâches. La page des limites de débit liste les nombres de tokens en file d’attente pour les trois paliers payants, et aucun pour l’offre gratuite. Lisez donc « gratuit » comme tarifé à zéro pour ces deux modèles, et non comme illimité.

💡 Testez avant de planifier : soumettez une tâche de dix requêtes sur l’un des deux modèles Flash-Lite, suivez son état et consultez la page des limites de débit de votre projet dans AI Studio. Ne bâtissez pas de calendrier de production autour d’une ligne batch gratuite tant que cette petite tâche n’a pas réussi.

Limites que vous rencontrerez

Vue en contre-plongée d’une allée de centre de données entre des armoires de serveurs gris mat

Les limites du batch se répartissent en deux groupes : la taille maximale d’une tâche unique, et la quantité de travail pouvant attendre en même temps.

Plafonds de taille des requêtes et des fichiers

LimiteValeur
Charge utile des requêtes en ligneMoins de 20 Mo au total
Taille de fichier d’entrée2 Go par fichier
Stockage de fichiers20 Go
Requêtes batch simultanées100
Expiration de la tâche48 heures si en attente ou en cours
Délai cible24 heures

Les requêtes en ligne conviennent aux petites tâches. Dès que la charge utile approche 20 Mo, passez à un fichier JSONL : une requête par ligne, chaque ligne contenant un identifiant de requête et le corps de la requête, importé via l’API Files.

Tokens en file d’attente par palier

Vue aérienne d’un port de fret avec des conteneurs empilés et une grue portique au crépuscule

La limite la plus contraignante n’est pas la taille des fichiers mais les tokens en file d’attente : le total des tokens en attente sur l’ensemble des tâches batch actives pour un modèle. Elle évolue avec votre palier de facturation.

PalierComment vous qualifierTokens en file d’attente (exemple)
Palier 1Compte de facturation lié3 000 000 pour Gemini 3.8 Flash
Palier 2$100 payés et 3 jours depuis le premier paiement réussi400 000 000 pour Gemini 3.8 Flash
Palier 3$1 000 payés et 30 jours depuis le premier paiement réussi1 000 000 000 pour la plupart des modèles

Pour un modèle dont la limite du palier 1 est de 3 000 000 de tokens, notre exemple de 15 millions de tokens d’entrée nécessiterait au moins cinq vagues distinctes. Sur le palier 2, il tient dans une seule tâche avec de la marge. Le passage du palier 1 au palier 2 est celui qui change la façon dont vous concevez un pipeline.

Délai de réponse et états des tâches

Ce que signifient réellement 24 heures

Une horloge murale analogique ronde à visage crème sur un mur de briques blanches, en lumière matinale

Google appelle 24 heures le délai cible et ajoute que, dans la plupart des cas, les résultats arrivent bien plus vite. Considérez cela comme un plafond autour duquel vous planifiez, et non comme une vitesse sur laquelle vous pouvez compter. Les petites tâches reviennent souvent rapidement, tandis que les grandes attendent la capacité disponible.

La limite stricte est 48 heures : une tâche encore en attente ou en cours à ce moment-là expire. Découper une grosse charge de travail en plusieurs tâches signifie qu’une expiration ou un échec ne vous coûte qu’une tranche au lieu de l’ensemble de l’exécution.

Autre piège : soumettre une tâche batch n’est pas idempotent. Si votre script expire après l’appel de création et que vous relancez, vous créez une deuxième tâche et payez les deux. Enregistrez le nom de la tâche renvoyé par la première réponse avant toute autre action.

Un rythme pratique est l’exécution nocturne. Soumettez la tâche en fin de journée de travail, laissez-la tourner pendant la nuit, et lisez les résultats avec votre premier café. Si une tâche est encore en attente après une journée complète, n’attendez pas l’expiration à 48 heures pour le savoir : vérifiez son état, regardez votre total de tokens en file d’attente pour ce modèle, et envisagez d’annuler puis de resoumettre en tranches plus petites.

États des tâches à surveiller

Un boulanger sortant des plateaux de pains dorés d’un rack en acier dans une boulangerie avant le lever du soleil

Comme pour une fournée de boulangerie, une tâche passe par plusieurs étapes, et vous ne récupérez la sortie qu’à la fin.

ÉtatSignification
JOB_STATE_PENDINGEn file d’attente, pas encore démarrée
JOB_STATE_RUNNINGLes requêtes sont en cours de traitement
JOB_STATE_SUCCEEDEDLes résultats sont prêts à être lus
JOB_STATE_FAILEDLa tâche a échoué, vérifiez son champ d’erreur
JOB_STATE_CANCELLEDLa tâche a été annulée
JOB_STATE_EXPIREDLa tâche a dépassé la fenêtre de 48 heures

Le code d’exemple de Google interroge l’état toutes les 30 secondes. Pour les tâches qui doivent durer des heures, un intervalle plus long évite des appels inutiles.

Soumettre une tâche batch en Python

Vue par-dessus l’épaule d’un développeur tapant sur un clavier à un bureau debout

Requêtes en ligne

Avec le SDK google-genai, une tâche en ligne prend une liste de requêtes, un nom de modèle et un nom d’affichage facultatif :

from google import genai

client = genai.Client()

inline_requests = [
    {"contents": [{"parts": [{"text": "Tell me a one-sentence joke."}], "role": "user"}]},
    {"contents": [{"parts": [{"text": "Why is the sky blue?"}], "role": "user"}]},
]

job = client.batches.create(
    model="gemini-3.8-flash",
    src=inline_requests,
    config={"display_name": "inlined-requests-job-1"},
)
print(job.name)

Pour une tâche par fichier, importez le JSONL avec client.files.upload, en utilisant mime_type='jsonl', puis passez uploaded_file.name comme src.

Interroger et lire les résultats

import time

finished_states = {
    "JOB_STATE_SUCCEEDED",
    "JOB_STATE_FAILED",
    "JOB_STATE_CANCELLED",
    "JOB_STATE_EXPIRED",
}

job = client.batches.get(name=job.name)
while job.state.name not in finished_states:
    time.sleep(30)
    job = client.batches.get(name=job.name)

if job.state.name == "JOB_STATE_SUCCEEDED":
    for i, item in enumerate(job.dest.inlined_responses):
        if item.response:
            print(i, item.response.text)
        elif item.error:
            print(i, item.error)

Les tâches par fichier renvoient plutôt un fichier de résultats : lisez job.dest.file_name et récupérez-le avec client.files.download.

Tester les prompts avant le batch

Une tâche batch est un retour d’information lent. Un mauvais prompt vous coûte une fenêtre de délai complète et une facture complète. Testez d’abord le prompt de façon interactive, sur une douzaine d’exemples variés, puis seulement ensuite mettez en file d’attente les milliers de requêtes.

Utiliser Gemini 3.5 Flash sur PicassoIA

Gemini 3.5 Flash sur PicassoIA exécute des prompts uniques dans votre navigateur, ce qui en fait un banc d’essai rapide. Il ne soumet pas de tâches de l’API Batch, celles-ci passent toujours par le SDK de Google. Voici la marche à suivre :

  1. Ouvrez la page du modèle et repérez le champ Prompt.
  2. Collez le prompt exact que vous prévoyez d’envoyer dans le batch, y compris les exemples éventuels.
  3. Ajoutez une instruction système qui définit le rôle et le format de sortie, par exemple « Renvoie un objet JSON par produit ».
  4. Choisissez un niveau de réflexion : aucun, faible ou élevé. Les niveaux plus élevés coûtent davantage de tokens de sortie dans votre batch réel, utilisez donc le plus bas qui fonctionne.
  5. Baissez la température pour l’extraction ou la classification. La valeur par défaut est 1 sur une échelle de 0 à 2.
  6. Joignez les médias si la tâche en a besoin. Le modèle accepte jusqu’à 10 images de 7 Mo chacune, de l’audio jusqu’à 8,4 heures et de la vidéo jusqu’à 45 minutes.
  7. Lancez dix exemples variés et lisez chaque réponse. Corrigez le prompt, puis relancez-les.
  8. Copiez le prompt final et l’instruction système dans vos requêtes batch.

La limite de sortie par défaut est de 65 535 tokens, donc fixez un plafond plus bas pour les tâches courtes. Dans un batch, chaque token non généré est de l’argent que vous économisez.

Besoin d’un second avis sur la qualité ? Gemini 3.1 Pro, Gemini 3 Flash et Gemini 2.5 Flash se trouvent dans la même collection de grands modèles de langage, ce qui vous permet de tester un prompt sur chacun d’eux avant de choisir le modèle qui ira dans la tâche.

Dépenser moins, puis créer des images

Trois collègues autour d’une table de réunion en chêne, examinant des graphiques à barres imprimés

Trois façons de réduire la facture

  1. Mettez en cache la partie commune. La mise en cache du contexte fonctionne dans les tâches batch aux tarifs de cache standard, donc un long prompt système répété dans 10 000 requêtes ne devrait pas être payé 10 000 fois.
  2. Choisissez le plus petit modèle qui convient. L’entrée de Gemini 3.5 Flash-Lite coûte $0,15 par million de tokens contre $0,75 pour Gemini 3.5 Flash, soit cinq fois moins, et son tarif de sortie de $1,25 représente environ 28 % de $4,50.
  3. Plafonnez la sortie. Des réponses courtes, un niveau de réflexion faible et une limite de sortie serrée réduisent la colonne la plus coûteuse de votre facture.

Évitez le batch lorsqu’une personne attend, lorsque les résultats alimentent un écran en direct, ou lorsque la tâche est si petite que le coût de l’interrogation dépasse la remise.

La même habitude consistant à tester à bas coût avant de dépenser gros vaut pour les visuels. Si votre tâche batch alimente un blog, un catalogue ou une application, vous voudrez probablement des images pour accompagner le texte. Ouvrez Nano Banana 2 sur PicassoIA et générez des images sans compteur de crédits en cours, essayez Seedream 5 Pro ou FLUX 2 Pro pour un rendu différent, et itérez jusqu’à obtenir le bon résultat. Parcourez toutes les options sur picassoia.com/en/all-models et créez votre première image dès aujourd’hui.

Partager cet article

Choisissez votre langue