Coût de l’API GPT-6 : tarifs, accès et options gratuites

GPT-6 Astra coûte $10 par million de tokens en entrée et $50 en sortie, tandis que Sol et Luna coûtent bien moins. Découvrez chaque surcharge, une facture mensuelle pour 100 000 requêtes, qui peut accéder à l’API et quelles options gratuites tiennent la route.

Coût de l’API GPT-6 : tarifs, accès et options gratuites
Cristian Da Conceicao
Fondateur de Picasso IA

Dix dollars en entrée, cinquante en sortie. C’est le prix d’un million de tokens de GPT-6 Astra via l’API, soit le double du tarif catalogue du modèle phare qui l’a précédé. Si vous espériez une mise à niveau bon marché, ce chiffre fait mal. Le piège, c’est que GPT-6 n’a pas un seul prix. C’est une famille à trois niveaux, et le plus petit modèle coûte environ un pour cent du plus grand.

Cet article rassemble tous les chiffres au même endroit : les tarifs par token d’Astra, Sol et Luna, les surcharges qui gonflent discrètement les factures, le coût de 100 000 requêtes réelles, qui peut vraiment appeler l’API, et les options gratuites qui tiennent la route. Les prix proviennent de comparateurs de tarifs publics début octobre. Considérez-les donc comme un instantané et vérifiez sur la page tarifaire d’OpenAI avant de vous engager sur un budget.

Ce que coûte GPT-6 par token

Astra a été dévoilé en aperçu limité le 3 septembre, puis ouvert au public le lendemain. Sol et Luna ont suivi le 22 septembre. Les trois partagent une fenêtre de contexte d’environ un million de tokens, avec jusqu’à 128K tokens en sortie, même si les comparateurs ne s’accordent pas sur le chiffre exact (1,05M contre 1,1M).

Astra, le prix du modèle phare

Astra est conçu pour les longues tâches agentiques : utilisation de l’ordinateur, automatisation de navigateur, grands chantiers de code. Cette ambition a un prix.

Ligne de facturationPrix par million de tokens
Entrée$10,00
Entrée en cache$1,00
Sortie$50,00
Entrée au-delà de 272K tokens$20,00
Sortie au-delà de 272K tokens$75,00
Batch ou Flex (entrée / sortie)$5,00 / $25,00

La sortie est la moitié coûteuse. Chaque token que le modèle écrit coûte cinq fois plus qu’un token qu’il lit, et les modèles très raisonneurs en écrivent beaucoup, y compris des tokens de réflexion que vous ne voyez jamais dans la réponse finale. Un premier test tiers a évalué Astra à environ $167 par tâche terminée sur des benchmarks agrégés, ce qui montre à quelle vitesse les exécutions agentiques s’accumulent.

Les mains d’une femme appuyant sur les touches d’une calculatrice à côté d’une pile en éventail de factures imprimées sur un bureau en chêne

Sol et Luna pour les petits budgets

Voici toute la famille côte à côte.

ModèleEntréeEntrée en cacheSortieUsage idéal
GPT-6 Astra$10,00$1,00$50,00Agents, codage difficile, longues recherches
GPT-6 Sol$2,00$0,10$10,00Codage quotidien, rédaction, réponses du support
GPT-6 Luna$0,10$0,01$0,50Routage, étiquetage, réponses courtes en volume

Sol coûte un cinquième d’Astra sur chaque ligne. Luna en coûte un centième. Pensez à trois tasses de café : la même boisson, une facture très différente.

Les tarifs par token sont abstraits, voici donc une traduction approximative. Un token correspond à environ les trois quarts d’un mot anglais. Un seul dollar de sortie d’Astra permet d’écrire environ 15 000 mots, soit presque un rapport de 30 pages. Ce même dollar achète environ 75 000 mots sur Sol et à peu près 1,5 million de mots sur Luna. Lire coûte moins cher qu’écrire, à tous les niveaux, ce qui explique pourquoi résumer un long document coûte bien moins cher que le rédiger.

Trois tasses de café en céramique, de taille petite, moyenne et très grande, sur le comptoir d’un café

La génération précédente n’est pas automatiquement moins chère. Selon un comparateur de tarifs, GPT 5.6 Sol est proposé à $4 en entrée et $20 en sortie pendant une période promotionnelle qui court jusqu’au 21 novembre, ce qui fait de GPT-6 Sol la ligne la moins chère sous le même nom de niveau. GPT 5.6 Terra s’affiche à $2 et $12, et GPT 5.6 Luna à $0,20 et $1,20, soit le double du tarif de GPT-6 Luna.

💡 Lecture rapide : si votre charge de travail n’a pas besoin d’agents ni de raisonnement poussé, le niveau Sol est la nouvelle option par défaut à évaluer en premier. Astra fait figure d’exception, pas de référence.

Alors, quand Astra vaut-il cinq fois le prix de Sol ? Quand une exécution ratée coûte plus que l’écart de prix : un agent qui consomme une heure de temps d’ingénieur, ou un projet juridique qui demanderait trois cycles de relecture. Le seuil de rentabilité est simple. Si Sol a besoin de plus de cinq tentatives pour égaler un bon résultat d’Astra, Astra l’emporte en matière de prix, sans autre argument. Si Sol y arrive en deux ou trois essais, vous payez trop cher.

Les surcharges qui gonflent la facture

Les prompts longs doublent le tarif

Dépassez 272K tokens en entrée et la requête entière est retarifée, pas seulement les tokens supplémentaires. L’entrée passe de $10 à $20 par million, et la sortie de $50 à $75.

Imaginez un lot de contrats de 300K tokens avec un résumé de 2K tokens en réponse :

  • Au tarif long contexte : $6,00 pour l’entrée plus $0,15 pour la sortie, soit $6,15.
  • Ramené à 270K tokens au tarif standard : $2,70 plus $0,10, soit $2,80.

Trente mille tokens de plus ont plus que doublé le prix de la même requête.

Un homme tenant une pile énorme de pages imprimées dans une allée silencieuse de bibliothèque

💡 Astuce : gardez un compteur de tokens dans votre pipeline et découpez les gros documents juste en dessous du seuil, plutôt que d’envoyer un seul prompt géant.

Mode rapide et majoration régionale

Deux autres multiplicateurs se cachent dans les petits caractères :

  • Le mode rapide coûte environ le double du tarif standard ($20 en entrée, $100 en sortie sur Astra) en échange d’une vitesse environ 2,5 fois supérieure. Il n’est pas disponible avec la résidence de données dans l’UE.
  • Les points de terminaison à résidence des données ajoutent 10 % au tarif du niveau que vous avez choisi.

Cumulez-les, et un appel Astra d’apparence anodine peut coûter plus du double de son prix catalogue. Décidez en connaissance de cause, pas par défaut.

Le mode rapide se justifie quand un humain attend la réponse, comme un assistant de codage interactif ou un chat de support en direct. Il est gaspillé sur les traitements de nuit, où personne ne surveille l’horloge. Ceux-là doivent aller dans la file batch, à moitié prix.

Coûts mensuels réels en dollars

Un ticket de support, chiffré

Prenons un bot de support où chaque ticket utilise 2 000 tokens en entrée et 500 en sortie. Sur Astra, cela fait $0,02 pour le prompt plus $0,025 pour la réponse, soit $0,045 par ticket. Un petit chiffre, jusqu’à ce qu’on le multiplie.

Un fondateur barbu en veste en jean examinant un relevé mensuel imprimé près de la fenêtre d’un café

La même charge de travail sur trois niveaux

Voici ce ticket précis, pour 100 000 tickets par mois :

ModèlePar ticket100 000 ticketsAvec remise batch
GPT-6 Astra$0,045$4 500$2 250
GPT-6 Sol$0,009$900$450
GPT-6 Luna$0,00045$45$22,50

Le cache est un autre levier. Si 1 500 des 2 000 tokens d’entrée sont toujours le même prompt système et les mêmes exemples, Astra descend à $0,0315 par ticket, soit $3 150 par mois. Cela économise $1 350 sans toucher à la qualité.

💡 Règle empirique : sur Astra, une réponse de 500 tokens ($0,025) coûte plus qu’un prompt de 2 000 tokens ($0,02). La longueur de la sortie détermine la facture.

Les tickets de support ne sont qu’une forme de charge de travail. Voici trois autres cas, chiffrés aux tarifs standard sans remise, pour trouver celui qui ressemble le plus à votre projet :

Charge de travailTokens par requêteRequêtes par moisLunaSolAstra
Application de chat pour développeur solo1 000 en entrée, 400 en sortie5 000$1,50$30$150
Équipe de contenu, brouillons3 000 en entrée, 2 500 en sortie300$0,47$9,30$46,50
Agents de codage200 000 en entrée, 30 000 en sortie440$15,40$308$1 540

Le tableau chiffre les tokens, pas la qualité. Un agent Luna n’égalera pas un agent Astra, lisez donc la dernière ligne comme un plafond et un plancher, pas comme une recommandation. Remarquez à quel point l’agent de codage écrase tout le reste : seulement 440 exécutions, mais $1 540 sur Astra. Mettre en cache 150K tokens sur chacun des 200K tokens du prompt ramène ce coût à environ $946.

Qui peut appeler l’API

Où commence l’API

Astra n’est pas disponible dans l’offre gratuite de l’API. Il vous faut au minimum un compte développeur Tier 1, c’est-à-dire un compte payant avec la facturation configurée. OpenAI n’avait pas publié de limites de débit détaillées ni de garanties de débit pour Astra au lancement. Vérifiez donc la page des limites dans votre tableau de bord une fois l’accès accordé.

Une main glissant une carte d’accès blanche sur un comptoir d’accueil en bois vers une autre main

Les abonnements ChatGPT sont séparés

Un abonnement ChatGPT ne vous donne pas de crédits API. Les deux sont facturés séparément, et le bon choix dépend de votre façon de travailler. Si vous discutez surtout, la formule Plus à $20 est généralement plus simple que de payer au token. Si vous créez un produit, il vous faut l’API quelle que soit la formule, car vos clients ne peuvent pas utiliser votre abonnement personnel. Dans l’application, l’accès à Astra se présente ainsi :

FormulePrix mensuelAccès à Astra
Free$0Non
Go$8Non
Plus$20Oui
ProÀ partir de $100Oui, avec des limites élargies
EnterprisePar siègeOui, désactivé par défaut

Luna n’était pas encore accessible aux utilisateurs gratuits de ChatGPT au moment de la rédaction, donc même le niveau le moins cher n’est pas pour autant gratuit dans l’application.

Avant votre premier appel API, parcourez cette courte liste :

  1. Ajoutez un moyen de paiement et un petit solde prépayé.
  2. Définissez un plafond de dépense mensuel dans le tableau de bord avant d’écrire la moindre ligne de code.
  3. Créez une clé API limitée à un projet et stockez-la dans une variable d’environnement, jamais dans le dépôt.
  4. Développez sur Luna, puis changez le nom du modèle une fois le pipeline opérationnel.
  5. Enregistrez les compteurs de tokens d’entrée, en cache et de sortie pour chaque requête, afin que la facture ne vous surprenne jamais.

Les options gratuites qui fonctionnent vraiment

Pourquoi Astra n’a pas d’offre gratuite

Aucun crédit d’essai n’a été publié pour Astra, et à $50 par million de tokens de sortie, ce n’est pas une surprise. Une seule exécution agentique un peu longue épuiserait n’importe quel crédit gratuit réaliste en quelques minutes.

Une étudiante qui révise avec un ordinateur portable et un cahier à une longue table de bibliothèque

Là où l’usage gratuit existe encore

Vous disposez encore de vraies pistes pour tester vos idées sans grosse facture :

  • Luna, l’option d’entrée économique. Cinq dollars de crédit permettent d’acheter environ 50 millions de tokens d’entrée ou 10 millions de tokens de sortie. Cela représente des milliers de courtes conversations.
  • Modèles à poids ouverts. GPT OSS 120B et GPT OSS 20B sont les versions à poids ouverts publiées par OpenAI. Si vous possédez le matériel, les faire tourner vous-même ne vous coûte aucun frais par token.
  • Modèles concurrents dans le navigateur. Essayez Claude Sonnet 5, Gemini 3.5 Flash ou GPT 5.4 avec vos vrais prompts avant de décider où dépenser.

Une méthode gratuite et pratique se déroule ainsi. Concevez le prompt dans un navigateur jusqu’à obtenir de bonnes réponses, figez-le, puis comptez les tokens d’une requête typique. Chiffrez-la vous-même avec une seule formule : (tokens d’entrée x tarif d’entrée + tokens de sortie x tarif de sortie) / 1 000 000. Appliquez-la à Luna, Sol et Astra, et vous connaîtrez votre fourchette mensuelle réelle avant qu’un seul appel payant ne parte.

Essayer GPT 5.6 Sol sur PicassoIA

Une remarque honnête : GPT-6 lui-même n’est pas encore dans la liste des modèles de PicassoIA. Ses plus proches parents sont la famille GPT 5.6 : GPT 5.6 Sol, GPT 5.6 Terra et GPT 5.6 Luna. Sol peut être essayé gratuitement en ligne sans aucune configuration, ce qui en fait une répétition peu coûteuse avant de vous engager sur un budget API.

Pas à pas sur PicassoIA

  1. Ouvrez la page GPT 5.6 Sol.
  2. Collez une tâche réelle de votre produit dans Prompt, pas un « bonjour ».
  3. Ajoutez un System Prompt pour définir le rôle et le ton.
  4. Choisissez un Reasoning effort entre none et xhigh. Commencez à none et ne montez que si les réponses paraissent superficielles.
  5. Réglez Verbosity sur low, medium ou high.
  6. Augmentez Max Completion Tokens si vous choisissez un niveau de raisonnement élevé, sinon la réflexion peut consommer tout le budget et laisser une réponse vide.
  7. Importez une capture d’écran ou un schéma dans Image Input si la tâche l’exige.
  8. Lancez l’exécution, puis répétez le même prompt sur GPT 5.6 Luna et comparez la qualité au prix.

Vue par-dessus l’épaule d’une jeune créatrice naviguant sur un ordinateur portable dans un espace de travail partagé et lumineux

Les réglages qui font varier votre coût

Les tokens de raisonnement sont facturés comme tokens de sortie sur les modèles de raisonnement, donc les réglages de cette page se traduisent directement sur la facture :

RéglageCe qu’il faitEffet sur le coût
Reasoning effort: none ou lowRéponses rapides, peu de réflexionLe plus bas
Reasoning effort: high ou xhighRéponses plus approfondies et plus lentesDavantage de tokens de sortie
Verbosity: lowRéponses courtes et directesMoins de tokens de sortie
Max Completion TokensPlafond strict de longueur de réponseLimite supérieure par requête

Les moyens de réduire la facture

Une main laissant tomber une pièce d’or dans un bocal en verre à moitié rempli de pièces, sur une table de cuisine

Router selon la difficulté

Envoyez les tâches faciles à Luna, les tâches intermédiaires à Sol, et seulement les 5 % les plus difficiles à Astra. Avec une répartition fictive de 80 % Luna, 15 % Sol et 5 % Astra, la charge de 100 000 tickets coûte environ $396 au lieu de $4 500.

Cache et batch

L’entrée en cache coûte 90 % de moins sur Astra et Luna, et 95 % de moins sur Sol. Le traitement Batch et Flex divise par deux le tarif standard pour tout ce qui peut attendre.

Un employé d’entrepôt scannant des rangées de colis en carton identiques dans un entrepôt lumineux

Limiter la sortie

Fixez une limite maximale de tokens et demandez des formats courts, comme des listes à puces ou du JSON compact. Comme la sortie coûte cinq fois plus que l’entrée, chaque phrase que vous supprimez est de l’argent économisé.

Trois erreurs qui gonflent les factures :

  • Renvoyer tout l’historique du chat à chaque tour. Une conversation de 10 tours qui ajoute 300 tokens par tour envoie 16 500 tokens en entrée au total, et non 3 000. Résumez les anciens tours ou mettez en cache le préfixe commun.
  • Laisser le raisonnement au niveau élevé pour les tâches faciles. Les tokens de réflexion sont facturés en sortie, le côté coûteux de la grille tarifaire.
  • Tester sur le modèle phare. Construisez et déboguez sur Luna, puis changez le nom du modèle pour l’exécution finale.

💡 Liste de contrôle : routez selon la difficulté, mettez en cache le préfixe répété, groupez en batch tout ce qui peut attendre, plafonnez la longueur des réponses et revérifiez les tarifs chaque mois, car les niveaux et les promotions changent.

À vous de créer

Le texte ne représente que la moitié du budget d’un produit. La plupart des lancements ont aussi besoin d’images : visuels principaux, vignettes, maquettes de produit. Essayez de créer vos propres images avec PicassoIA et voyez jusqu’où un prompt peut aller. Seedream 4.5 est excellent pour les détails nets en 4K, P-Image est rapide pour les brouillons, et GPT Image 2 suit de près les prompts longs.

Choisissez une scène de votre propre projet, écrivez trois prompts avec des angles de caméra différents et lancez-les côte à côte. Parcourez le catalogue complet sur picassoia.com/en/all-models et commencez à expérimenter dès aujourd’hui.

Partager cet article

Choisissez votre langue