Deux pages tarifaires d’API peuvent sembler presque identiques et pourtant produire des factures qui diffèrent de plusieurs milliers de dollars. C’est précisément la situation actuelle de Claude et d’OpenAI. Aux tarifs publics, les deux fournisseurs correspondent au centime près dans quatre paliers, donc l’option la moins chère dépend de la façon dont vous appelez le modèle, et non du logo figurant sur la facture. Cette analyse de tarifs de l’API Claude et de l’API OpenAI place côte à côte les prix par million de tokens, puis calcule ce que le caching, les traitements par lots, les prompts longs et les tokens de raisonnement changent à une facture mensuelle réelle.
💡 Tous les prix sont en USD par million de tokens (MTok), relevés sur les pages tarifaires officielles de chaque fournisseur au moment de la rédaction. Les tarifs changent souvent, consultez donc les pages en ligne avant de fixer un budget.

La réponse courte
Aucun des deux fournisseurs n’est moins cher sur toute la ligne. Palier par palier, les tarifs publics sont soit identiques, soit proches, et l’écart réel apparaît surtout à trois endroits : l’entrée mise en cache, les prompts très longs et les plus petits modèles les moins chers. Si vous ne comparez que le tarif d’entrée affiché en vitrine, vous passez à côté de l’essentiel.
Là où les prix correspondent exactement
Quatre paliers s’alignent au centime près :
- Claude Haiku 5.5 et GPT-6 Luna : 0,10 $ en entrée, 0,50 $ en sortie (Haiku 5.5 pour les prompts allant jusqu’à 100K tokens).
- Claude Sonnet 5.5 et GPT-6 Sol : 2 $ en entrée, 10 $ en sortie.
- Claude Opus 5.5 et GPT 5.6 Sol : 4 $ en entrée, 20 $ en sortie.
- Claude Fable 5.1 et GPT-6 Astra : 10 $ en entrée, 50 $ en sortie.
Le tableau d’OpenAI liste à la fois une génération GPT 5.6 et une génération GPT-6, et les noms Luna et Sol apparaissent dans les deux avec des prix différents. Vérifiez le numéro de génération avant de comparer deux lignes. Quand les tarifs publics coïncident à ce point, les économies se cachent dans les détails ci-dessous.
Ce que chaque camp remporte
Claude prend l’avantage sur :
- Les lectures du cache. Claude Opus 5.5 et Claude Sonnet 5.5 facturent les succès du cache à 5 % du prix d’entrée. OpenAI affiche l’entrée mise en cache à 10 % du prix d’entrée sur la plupart des modèles.
- Les prompts longs. Les modèles de Claude à partir de la génération 4.6, à l’exception de Haiku 5.5, appliquent un seul tarif par token sur toute la fenêtre de 1M tokens. OpenAI augmente ses tarifs dès que l’entrée dépasse 272K tokens.
- Les modèles de raisonnement haut de gamme. Claude Opus 5.5 (4 $ et 20 $) est moins cher que GPT-5.5 (5 $ et 30 $).
OpenAI prend l’avantage sur :
- Le bas de l’échelle. GPT 5 Nano à 0,05 $ en entrée et 0,40 $ en sortie affiche les tarifs les plus bas des tableaux ci-dessous.
- Davantage de paliers intermédiaires. GPT 5 Mini et GPT 5 Nano vous permettent d’adapter la taille du modèle à la tâche de façon plus fine que le petit palier de Claude.
Les paliers de prix côte à côte
Les tableaux regroupent les modèles par rôle plutôt que par fournisseur, pour que vous puissiez lire un palier en ligne. Tous les chiffres sont par million de tokens.

Modèles économiques
| Modèle | Entrée | Entrée mise en cache | Sortie |
|---|
| Claude Haiku 5.5 (prompts jusqu’à 100K) | 0,10 $ | 0,01 $ | 0,50 $ |
| GPT-6 Luna | 0,10 $ | 0,01 $ | 0,50 $ |
| GPT 5.6 Luna | 0,20 $ | 0,02 $ | 1,20 $ |
| GPT 5 Mini | 0,25 $ | 0,025 $ | 2,00 $ |
| GPT 5 Nano | 0,05 $ | 0,005 $ | 0,40 $ |
| Claude 4.5 Haiku | 1,00 $ | 0,10 $ | 5,00 $ |
Claude Haiku 5.5 est le seul modèle Claude à tarification selon la longueur : au-delà de 100K tokens, les prompts sont facturés 0,50 $ en entrée et 2,50 $ en sortie. Le Claude 4.5 Haiku plus ancien coûte dix fois plus cher que Haiku 5.5, en entrée comme en sortie.
Pour un classifieur ou un routeur à fort volume, la lutte se joue entre GPT 5 Nano, Haiku 5.5 et GPT-6 Luna. Nano est le moins cher au token, mais les deux autres sont des générations plus récentes, alors faites un contrôle de qualité avant de considérer que le tarif le plus bas l’emporte.
Modèles intermédiaires
| Modèle | Entrée | Entrée mise en cache | Sortie |
|---|
| Claude Sonnet 5.5 | 2,00 $ | 0,10 $ | 10,00 $ |
| Claude Sonnet 5 | 2,00 $ | 0,20 $ | 10,00 $ |
| GPT-6 Sol | 2,00 $ | 0,20 $ | 10,00 $ |
| GPT 5.6 Terra | 2,00 $ | 0,20 $ | 12,00 $ |
| GPT 5.4 | 2,50 $ | 0,25 $ | 15,00 $ |
| Claude Sonnet 4.6 | 3,00 $ | 0,30 $ | 15,00 $ |
C’est la sortie qui détermine ce palier, car les tâches de conversation et de rédaction produisent de longues réponses. GPT 5.6 Terra facture 20 % de plus par token de sortie que Claude Sonnet 5.5, pour le même tarif d’entrée de 2 $. GPT 5.4 coûte 25 % de plus que Sonnet 5.5 en entrée et 50 % de plus en sortie.
Passer de Claude Sonnet 4.6 à Sonnet 5.5 réduit le tarif d’un tiers sur le papier. La section sur le tokenizer ci-dessous montre pourquoi l’économie réelle est plus petite.
Modèles phares
| Modèle | Entrée | Entrée mise en cache | Sortie |
|---|
| Claude Opus 5.5 | 4,00 $ | 0,20 $ | 20,00 $ |
| GPT 5.6 Sol | 4,00 $ | 0,40 $ | 20,00 $ |
| Claude Opus 4.7 | 5,00 $ | 0,50 $ | 25,00 $ |
| GPT-5.5 | 5,00 $ | 0,50 $ | 30,00 $ |
| Claude Fable 5.1 | 10,00 $ | 0,25 $ | 50,00 $ |
| GPT-6 Astra | 10,00 $ | 1,00 $ | 50,00 $ |
Claude Opus 5.5 et GPT 5.6 Sol correspondent en entrée comme en sortie. La différence se situe dans la colonne de l’entrée mise en cache : 0,20 $ contre 0,40 $. GPT-5.5 coûte 25 % de plus qu’Opus 5.5 en entrée et 50 % de plus en sortie. Claude Opus 4.7 et Claude Opus 4.6 sont tous deux affichés à 5 $ et 25 $, donc le plus récent Opus est aussi le moins cher..
Tout en haut de la gamme, Claude Fable 5.1 et GPT-6 Astra sont identiques au tarif public. Le tarif de 0,25 $ pour une lecture du cache contre 1,00 $ rend Claude quatre fois moins cher pour le contexte répété. Claude Fable 5 partage le tarif public de 10 $ et 50 $, mais facture les succès du cache à 1 $, soit quatre fois le tarif de Fable 5.1.

Ce qui change aussi votre facture
Quatre leviers font plus bouger le total que la grille tarifaire : le caching, le traitement par lots, la longueur des prompts et le raisonnement. Chacun avantage un fournisseur différent selon la situation.
Le calcul du caching des prompts
Le caching est le point où les deux fournisseurs divergent le plus. Claude vous laisse payer une petite surcharge pour écrire un préfixe de prompt dans un cache, puis le relire avec une forte réduction.
| Événement de cache | Claude | OpenAI |
|---|
| Écriture, cache de 5 minutes | 1,25x le prix d’entrée | Aucun prix d’écriture distinct indiqué |
| Écriture, cache d’1 heure | 2x le prix d’entrée | Aucun prix d’écriture distinct indiqué |
| Lecture | 0,1x le prix d’entrée (0,05x sur Opus 5.5 et Sonnet 5.5, 0,025x sur Fable 5.1) | 0,1x sur la plupart des modèles listés |
Une écriture de 5 minutes chez Claude est rentabilisée dès une seule lecture du cache. Si votre application envoie le même prompt système, les mêmes définitions d’outils ou le même document de référence à chaque requête, le caching réduit cette partie de la facture de 90 % à 97,5 % chez Claude. La remise de 90 % d’OpenAI sur l’entrée mise en cache suit de près, mais Opus 5.5 et Sonnet 5.5 divisent encore par deux le coût restant.
Pensez-y comme à la mise en place dans une cuisine de restaurant. Les ingrédients préparés une seule fois servent chaque commande plus vite et à moindre coût, et un préfixe de prompt mis en cache fonctionne de la même manière.

Remises sur les traitements par lots
Les deux fournisseurs accordent 50 % de réduction pour les travaux pouvant attendre. L’API Batch d’Anthropic divise par deux les tarifs d’entrée et de sortie : Claude Sonnet 5.5 passe ainsi à 1 $ en entrée et 5 $ en sortie, et Claude Opus 5.5 à 2 $ et 10 $. La page tarifaire d’OpenAI affiche la même réduction de 50 % sur son palier batch et propose aussi un palier Flex facturé au tarif batch pour les requêtes qui tolèrent des réponses plus lentes.
Les classifications nocturnes, les résumés en masse, l’étiquetage de jeux de données et les campagnes d’évaluation entrent tous dans cette catégorie. Anthropic indique que les remises batch et de caching peuvent se cumuler, car les multiplicateurs s’empilent.
💡 Le mode rapide fonctionne dans le sens inverse. Claude Opus 5.5 en mode rapide coûte 8 $ en entrée et 40 $ en sortie, exactement le double du tarif standard, en échange d’une sortie plus rapide. Si la latence ne pose pas de problème pour votre produit, ne payez pas pour cela.

Surcharges pour contexte long
OpenAI scinde ses tarifs à 272K tokens d’entrée. En dessous de ce seuil, vous payez le tarif pour contexte court. Au-delà, le tarif pour contexte long s’applique : 8 $ en entrée et 30 $ en sortie pour GPT 5.6 Sol, contre 4 $ et 20 $ sous le seuil. Les modèles de Claude à partir de la génération 4.6 incluent toute la fenêtre de 1M tokens au tarif standard, si bien qu’une requête de 900K tokens est facturée au même tarif par token qu’une requête de 9K. L’exception est Haiku 5.5, qui augmente au-delà de 100K tokens.
Voici ce que cela signifie pour une requête qui envoie 400K tokens de code source et renvoie 2 000 tokens :
- Claude Opus 5.5 : 0,4 × 4 $ + 0,002 × 20 $ = 1,64 $
- GPT 5.6 Sol aux tarifs contexte long : 0,4 × 8 $ + 0,002 × 30 $ = 3,26 $
- GPT-5.5 aux tarifs contexte long (10 $ et 45 $) : 0,4 × 10 $ + 0,002 × 45 $ = 4,09 $
Refaites cela 1 000 fois et l’écart entre Opus 5.5 et Sol atteint 1 620 $. Une réserve : les deux fournisseurs ne comptent pas les tokens de la même façon, donc la même base de code ne mesurera pas exactement 400K des deux côtés.

Exemples de coûts mensuels réels
Les grilles tarifaires restent abstraites. Deux charges de travail les rendent concrètes.

Un bot de support
Prenons un assistant de support qui traite un million de requêtes par mois. Chaque requête envoie 1 500 tokens d’entrée (prompt système plus le message du client) et renvoie 500 tokens de sortie. Cela représente 1 500 MTok en entrée et 500 MTok en sortie par mois, sans caching ni traitement par lots.
| Modèle | Calcul | Coût mensuel |
|---|
| GPT 5 Nano | 1 500 × 0,05 $ + 500 × 0,40 $ | 275 $ |
| Claude Haiku 5.5 | 1 500 × 0,10 $ + 500 × 0,50 $ | 400 $ |
| GPT-6 Luna | 1 500 × 0,10 $ + 500 × 0,50 $ | 400 $ |
| GPT 5.6 Luna | 1 500 × 0,20 $ + 500 × 1,20 $ | 900 $ |
| Claude Sonnet 5.5 | 1 500 × 2 $ + 500 × 10 $ | 8 000 $ |
| GPT-6 Sol | 1 500 × 2 $ + 500 × 10 $ | 8 000 $ |
| GPT 5.6 Terra | 1 500 × 2 $ + 500 × 12 $ | 9 000 $ |
| GPT 5.4 | 1 500 × 2,50 $ + 500 × 15 $ | 11 250 $ |
| Claude Opus 5.5 | 1 500 × 4 $ + 500 × 20 $ | 16 000 $ |
| GPT 5.6 Sol | 1 500 × 4 $ + 500 × 20 $ | 16 000 $ |
| GPT-5.5 | 1 500 × 5 $ + 500 × 30 $ | 22 500 $ |
Sans caching, les deux fournisseurs sont presque partout à égalité. Le seul perdant net est GPT-5.5, qui coûte 6 500 $ de plus par mois qu’Opus 5.5 pour le même trafic. GPT 5.6 Terra ajoute 1 000 $ par rapport à Sonnet 5.5, et tout cet écart vient du tarif de sortie.
Supposons maintenant que 1 200 de ces 1 500 tokens d’entrée forment un prompt système fixe, qui est lu dans le cache à presque chaque requête. Claude Sonnet 5.5 tombe à 5 720 $, GPT-6 Sol à 5 840 $ et GPT 5.6 Terra à 6 840 $. Sonnet devance donc Sol de 120 $ et Terra de 1 120 $, avant la petite charge d’écriture dans le cache. Les tokens de sortie dominent toujours, puisque 5 000 $ sur les 5 720 $ de Sonnet correspondent à la sortie, ce qui explique que l’écart avec Sol reste faible.
Un flux de documents répétés
Prenons maintenant un assistant de recherche qui répond à des questions sur un même document de référence de 20 000 tokens. Il traite 100 000 questions par mois et le document est identique à chaque fois, donc le préfixe répété représente 2 000 MTok au total. La sortie est facturée de la même manière des deux côtés, donc ne comparez que le côté entrée.
| Configuration | Coût du document répété |
|---|
| Claude Opus 5.5, sans caching | 8 000 $ |
| Claude Opus 5.5, lectures du cache | 400 $ |
| GPT 5.6 Sol, entrée mise en cache | 800 $ |
| Claude Sonnet 5.5, lectures du cache | 200 $ |
| GPT 5.6 Terra, entrée mise en cache | 400 $ |
Les chiffres de Claude supposent que le cache reste actif. À environ 2,3 requêtes par minute, c’est le cas, car chaque lecture renouvelle la fenêtre de 5 minutes. Une charge d’écriture de 1,25x à chaque fois que le cache expire change à peine le total.
Sur le même palier, les lectures du cache de Claude coûtent la moitié de celles d’OpenAI. Pour un produit qui lit beaucoup, cela représente des centaines de dollars par mois à cette échelle, et des milliers à plus grande échelle.
Les coûts cachés dont personne ne parle
Les tarifs publics ne décrivent que les tokens que vous prévoyez d’envoyer. Trois éléments modifient discrètement le nombre de tokens que vous payez.
Les tokens de raisonnement
La réflexion est facturée comme de la sortie. Sur les deux plateformes, les tokens que le modèle consomme pour raisonner avant de répondre sont facturés au tarif de sortie, la colonne la plus chère. Une requête hypothétique qui renvoie une réponse de 300 tokens après 2 000 tokens de raisonnement est facturée comme 2 300 tokens de sortie. Sur Claude Opus 5.5, cela fait 0,046 $ au lieu de 0,006 $, soit près de huit fois plus pour la même réponse visible.
Les deux fournisseurs vous donnent un réglage. Claude Sonnet 5 propose un paramètre d’effort où le niveau bas désactive la réflexion pour des réponses plus rapides et moins chères, et GPT 5.6 Terra propose un paramètre d’effort de raisonnement qui vaut par défaut « none ». Commencez au niveau le plus bas et ne le montez que lorsque les réponses deviennent moins bonnes.
Différences de tokenizer
Anthropic indique que les modèles Claude à partir de la version 4.7 utilisent un tokenizer plus récent qui produit environ 30 % de tokens en plus pour le même texte que l’ancien. Cela compte pour les mises à niveau au sein de la gamme Claude. Passer de Sonnet 4.6 à Sonnet 5.5 réduit le tarif d’un tiers, mais si votre texte se découpe désormais en 30 % de tokens supplémentaires, l’économie nette est plus proche de 13 %.
La même logique vaut entre fournisseurs. Un tarif par token n’est pas un coût par mot, et il n’existe aucune conversion publique entre les deux tokenizers. L’objet d’usage renvoyé avec chaque réponse indique les tokens d’entrée et de sortie facturés, alors mesurez plutôt que de deviner.
Frais des outils et de recherche
Les outils intégrés ont leurs propres frais. Sur Claude, la recherche web coûte 10 $ pour 1 000 recherches, plus les tokens que les résultats ajoutent à votre prompt. La récupération de pages web n’ajoute aucun frais au-delà des tokens, et l’exécution de code est gratuite lorsqu’elle est utilisée avec la recherche ou la récupération web. L’exécution de code autonome inclut 1 550 heures gratuites par mois, puis 0,05 $ par heure et par conteneur.
Fixer l’inférence de Claude au traitement aux États-Unis multiplie chaque catégorie de tokens par 1,1x. OpenAI tarifie séparément ses propres outils intégrés sur sa page tarifaire, donc ajoutez ces lignes au même tableur avant de comparer les totaux.
Vous avez maintenant les tarifs, les multiplicateurs et deux exemples chiffrés. La dernière étape porte sur votre propre trafic.

Testez 50 vrais prompts
Extrayez 50 requêtes réelles de vos journaux, y compris les plus désordonnées. Envoyez chacune à deux candidats du même palier. Notez les tokens d’entrée et de sortie facturés, et indiquez si la réponse était assez bonne pour être livrée. Multipliez par les tarifs de chaque fournisseur, en incluant les tarifs cache et batch lorsqu’ils s’appliquent.
Le modèle au coût le plus bas par réponse acceptable est le moins cher, même lorsque sa grille tarifaire paraît moins bonne. Un modèle qui a besoin de deux essais pour donner la bonne réponse coûte le double, quel que soit le prix par million de tokens.
| Votre charge de travail | Probablement le moins cher | Pourquoi |
|---|
| Des millions d’appels de classification courts | GPT 5 Nano, puis Haiku 5.5 ou GPT-6 Luna | Tarifs publics les plus bas |
| Conversation avec un long prompt système fixe | Claude Sonnet 5.5 ou Opus 5.5 | Lectures du cache à 5 % du prix d’entrée |
| Dépôts ou contrats entiers au-delà de 272K tokens | Claude Opus 5.5 | Un seul tarif jusqu’à 1M tokens |
| Traitements nocturnes en masse | Les deux | Chacun offre 50 % de réduction, donc choisissez selon la qualité |
| Rédaction riche en sortie dans le palier intermédiaire | Claude Sonnet 5.5 ou GPT-6 Sol | 10 $ en sortie contre 12 $ pour Terra |
| Raisonnement haut de gamme avec contexte répété | Claude Fable 5.1 | Lectures du cache à 0,25 $ contre 1,00 $ |
Testez les deux modèles sur PicassoIA
Avant de brancher un SDK à votre produit, faites passer le même prompt par les modèles des deux fournisseurs directement dans le navigateur. PicassoIA héberge à la fois Claude Sonnet 5 et GPT 5.6 Terra dans sa collection de grands modèles de langage, vous pouvez donc comparer les réponses côte à côte sans écrire de code.
Comparez-les en cinq étapes
- Ouvrez la page Claude Sonnet 5 et collez un vrai prompt de votre produit dans le champ Prompt. Placez vos instructions de production dans System Prompt.
- Laissez Effort sur low, la valeur par défaut, qui désactive la réflexion. Gardez Max Tokens à 8 192 ou réduisez-le pour correspondre à votre limite réelle de sortie, puis lancez l’exécution et copiez la réponse.
- Ouvrez la page GPT 5.6 Terra et collez le même prompt et le même prompt système. Laissez Reasoning Effort sur none et réglez Verbosity sur medium.
- Comparez la longueur et la qualité des réponses. Les tokens de sortie sont la partie coûteuse de la facture, donc une réponse plus courte qui fait le travail est une économie directe.
- Montez Effort sur Claude et Reasoning Effort sur Terra à medium, relancez les deux, et vérifiez si le gain de qualité justifie les tokens de raisonnement supplémentaires évoqués plus haut.
💡 Les deux modèles acceptent les images, vous pouvez donc joindre une capture d’écran pour tester aussi les tâches de vision. L’entrée d’image ajoute des tokens : la page de Claude Sonnet 5 indique largeur × hauteur ÷ 750 tokens d’entrée.
Créez ensuite vos propres images
L’habitude qui fait économiser sur les modèles de texte fonctionne aussi pour la génération d’images : testez petit, ajustez, puis passez à l’échelle. Rédigez un prompt, générez le rendu, changez la lumière ou l’objectif, puis générez à nouveau. Les photos de cet article ont toutes été générées à partir de prompts textuels et de quelques retouches rapides.

Ouvrez la bibliothèque de modèles de PicassoIA, choisissez un modèle de texte vers image et décrivez la scène souhaitée : sujet, lumière, objectif, ambiance. Lancez ensuite le même prompt sur un deuxième modèle et comparez les résultats. Quelques minutes d’expérimentation vous montrent quel modèle correspond à votre style, et chaque rendu est une occasion de construire un visuel qui fera ressortir votre prochain article, fiche produit ou campagne.