Comparatif des tarifs des API d’IA 2027 : images, vidéo, voix et LLM

Tarifs publics réels des tokens de LLM, des générations d’images, des secondes de vidéo et des caractères de voix, côte à côte. Voyez ce que coûtent un bot de support, 1 000 images, 100 clips vidéo et une narration de dix minutes, ainsi que les frais cachés, les nouvelles tentatives et les remises qui modifient le total.

Comparatif des tarifs des API d’IA 2027 : images, vidéo, voix et LLM
Cristian Da Conceicao
Fondateur de Picasso IA

Choisir une API d’IA sur son prix affiché est un moyen sûr de dépasser son budget. Un tarif par token bas ne veut pas dire grand-chose si votre charge de travail consomme dix fois plus de tokens, et un prix par seconde de vidéo peu élevé grimpe vite dès que vous ajoutez le 1080p, l’audio et quelques nouvelles tentatives. Ce comparatif des tarifs des API d’IA place côte à côte les tarifs publics réels des modèles de langage, des générateurs d’images, des modèles vidéo et de la synthèse vocale, puis les transforme en factures mensuelles que vous pouvez vérifier avec votre propre charge de travail.

En résumé : les prix des LLM couvrent un écart de 100x entre le niveau le moins cher et le plus cher, un même modèle d’image varie de 35x entre ses réglages de qualité basse et haute, la vidéo va de $0,02 à $0,60 par seconde, et la voix va d’un demi-cent à dix cents pour 1 000 caractères. Les tarifs ci-dessous ont été vérifiés en octobre 2026 à partir des grilles tarifaires des fournisseurs et des suivis publics de prix. Considérez chaque chiffre comme un instantané et confirmez-le sur la page du fournisseur avant de vous engager sur un budget.

Mains d’un développeur tapant sur un clavier sur un bureau bien rangé, à côté d’une lampe en laiton chaude

Comment la facturation des API fonctionne vraiment

Quatre modalités, quatre compteurs différents. Les confondre est la raison la plus fréquente pour laquelle une API « bon marché » finit par coûter cher.

Quatre unités, quatre pièges

  • Les LLM sont facturés par million de tokens. Les tokens de sortie coûtent environ 5 à 6 fois plus que les tokens d’entrée, donc ce sont les réponses longues qui font grimper la facture, pas les prompts longs.
  • Les images sont facturées par image, par mégapixel ou par token. Les réglages de qualité et de résolution peuvent multiplier le prix par 35 sur le même modèle.
  • La vidéo est facturée par seconde de sortie. Les niveaux de résolution et l’audio modifient le tarif, et certains modèles sont facturés par token, donc tout chiffre par seconde n’est qu’une estimation.
  • La voix est facturée par 1 000 caractères ou par seconde d’audio généré. C’est la catégorie la moins chère, mais le niveau du modèle fait tout de même varier le coût de 20x.

Des réductions qui existent vraiment

Quatre leviers apparaissent chez presque tous les fournisseurs :

  1. Le traitement par lots réduit de 50 % les prix des tokens pour les travaux qui peuvent attendre. Anthropic le documente clairement, et OpenAI propose la même réduction de moitié.
  2. Le cache de prompts facture le contexte répété à environ 10 % du prix d’entrée normal. Sur Claude Opus 5.5 et Claude Sonnet 5.5, une lecture en cache tombe à 5 %, et sur Claude Fable 5.1 à 2,5 %.
  3. Les fenêtres promotionnelles existent, mais sont temporaires. GPT 5.6 Sol est à $4 en entrée et $20 en sortie jusqu’au 21 novembre 2026 au moins, et ElevenLabs v4 bénéficie d’une remise de 72 % qui prend fin le 12 octobre. Budgétez au tarif normal.
  4. La résidence des données fonctionne dans l’autre sens. Épingler l’inférence de Claude aux États-Unis ajoute un multiplicateur de 1,1x sur chaque catégorie de tokens.

Vue de dessus d’une calculatrice, d’un ticket de caisse et d’un carnet de calculs manuscrits sur un bureau en noyer

Prix des API de LLM côte à côte

Les modèles de langage présentent l’écart de prix le plus large de toutes les catégories ici, et le milieu du marché a discrètement convergé.

La grille tarifaire

Les prix sont en USD par million de tokens, aux tarifs standard hors traitement par lots.

ModèleEntréeSortieRemarques
Claude Haiku 5.5$0,10$0,50Prompts jusqu’à 100k tokens
GPT 5.6 Luna$0,20$1,20Niveau rapide
Gemini 3.5 Flash$1,50$9,00Niveau rapide
Claude Sonnet 5$2,00$10,00Sonnet 5.5 coûte le même prix
GPT 5.6 Terra$2,00$12,00Niveau intermédiaire
Gemini 3.1 Pro$2,00$12,00$4 / $18 au-delà de prompts de 200k tokens
GPT 5.6 Sol$4,00$20,00Tarif promo jusqu’au 21 novembre
Claude Opus 5.5$4,00$20,00Niveau de raisonnement haut de gamme
Claude Fable 5$10,00$50,00Le plus cher ici

Les chiffres d’Anthropic et de Google proviennent de leurs pages tarifaires officielles. Ceux d’OpenAI proviennent de suivis publics, car la page d’OpenAI n’était pas lisible au moment où j’ai vérifié ; vérifiez-les donc avant d’établir une prévision budgétaire.

💡 Comparez d’abord les prix de sortie. Trois modèles de milieu de gamme partagent le même tarif d’entrée de $2, donc l’écart réel se situe en sortie : $10 pour Sonnet 5, $12 pour Terra et Gemini 3.1 Pro. Sur des charges de travail riches en conversations, cette différence de 20 % compte plus que le tarif d’entrée.

Ce que coûte un bot de support

Prenez un petit assistant de support qui envoie 10 millions de tokens en entrée et reçoit 2 millions de tokens en sortie chaque mois.

ModèleCoût mensuel
Claude Haiku 5.5$2,00
GPT 5.6 Luna$4,40
Gemini 3.5 Flash$33,00
Claude Sonnet 5.5$40,00
GPT 5.6 Terra$44,00
Gemini 3.1 Pro$44,00
GPT 5.6 Sol$80,00
Claude Opus 5.5$80,00
Claude Fable 5.1$200,00

L’option la moins chère et l’option la plus chère diffèrent exactement de 100x sur le même trafic. La plupart des questions de support n’ont pas besoin d’un modèle de pointe ; acheminez donc les tickets courants vers un niveau petit et ne remontez que les plus difficiles.

Le cache change encore la donne. Si 80 % de ces tokens d’entrée sont des instructions répétées servies depuis le cache au tarif de lecture de $0,10 par million de Sonnet 5.5, la dépense en entrée passe de $20 à environ $4,80, et le total de $40 à environ $25, avant les coûts ponctuels d’écriture en cache. Le traitement par lots se cumule, donc un travail qui peut attendre la nuit tombe autour de $12.

Quatre collègues réunis devant un tableau blanc couvert de post-it, dans un bureau lumineux

Coût de génération d’images par image

Les API d’images paraissent bon marché jusqu’à ce que vous remarquiez le nombre de réglages de qualité qui se cachent derrière un seul nom de modèle.

Tableau des prix par image

ModèlePrix par imageRemarques
GPT Image 2$0,006 basse, $0,053 moyenne, $0,211 hauteTarifs publics pour 1024x1024
Nano Banana 2$0,0336 en 1K, $0,0504 en 2K, $0,113 en 4KGoogle indique la mise à jour 2.1 à ces tarifs
Seedream 5 ProEnviron $0,035Estimation d’un suivi de prix
FLUX.2 proEnviron $0,03 par mégapixelEstimation d’un suivi de prix
Nano Banana 2 LiteEnviron $0,01Estimation d’un suivi de prix

Le piège des niveaux de qualité

Générez 1 000 images par mois avec le même modèle OpenAI et cela coûte $6 en qualité basse, $53 en moyenne et $211 en haute. Nano Banana 2 en 2K tombe autour de $50, Seedream 5 Pro autour de $35 et Nano Banana 2 Lite autour de $10. Le réglage que vous laissez par défaut pèse davantage sur la facture que le modèle que vous choisissez.

Les revendeurs ajoutent une couche supplémentaire. Une passerelle affichait GPT Image 2 à exactement le double du tarif d’OpenAI pour chaque niveau, ce qui transforme un travail à $211 en un travail à $422, sans aucun changement dans le résultat.

💡 Brouillon en basse qualité, finition en haute qualité. Générez les concepts au niveau le moins cher, retenez les meilleurs, puis ne refaites le rendu que de ceux-ci en qualité maximale. Un taux de finalistes de 10 % en haute qualité coûte encore bien moins que de tout générer en haute qualité.

Gros plan d’un objectif d’appareil photo hybride, avec des photographies imprimées floues derrière

Tarifs API vidéo à la seconde

La vidéo est le domaine où une mauvaise estimation coûte de l’argent réel, car chaque seconde est facturée et chaque nouvelle tentative répète le prix complet.

Grille tarifaire avec audio

ModèlePrix par secondeRemarques
P Video$0,02 en 720p, $0,04 en 1080pAudio inclus
Veo 3.1 Lite$0,05 en 720p, $0,08 en 1080pAudio inclus
Grok Imagine Video 1.5$0,08Jusqu’à 1080p
Veo 3.1 Fast$0,10 en 720p, $0,12 en 1080p, $0,30 en 4KAudio inclus
Kling v3 VideoEnviron $0,11Niveau Turbo officiel, 720p
HappyHorse 1.1Environ $0,125 en 720p, $0,22 en 1080pAudio et vidéo conjoints
LTX 2.3 Fast$0,06 à $0,24De 1080p jusqu’à 4K
Veo 3.1$0,40 en 720p et 1080p, $0,60 en 4KNiveau de qualité haut de gamme

Les tarifs de Veo, Grok et P Video sont publiés par leurs créateurs. Les chiffres de Kling et HappyHorse sont convertis depuis le yuan, donc des arrondis de change s’appliquent.

Ce que coûtent 100 clips

Supposons 100 clips de 8 secondes en 720p, soit 800 secondes de séquences.

  • P Video : $16
  • Veo 3.1 Lite : $40
  • Grok Imagine Video 1.5 : $64
  • Veo 3.1 Fast : $80
  • Kling 3.0 Turbo : $88
  • HappyHorse : $100
  • Veo 3.1 : $320

Ces totaux supposent que chaque clip est utilisable. Avec un taux de conservation de 30 %, il faut environ 333 générations pour obtenir 100 bons clips, donc la ligne de Veo 3.1 Fast passe de $80 à environ $267.

Trois pièges se cachent derrière ces chiffres. Seedance 2.0 et sa variante Fast sont facturés au token, donc les prix par seconde ne sont que des estimations, et les revendeurs annoncent entre environ $0,09 et $0,25. Passer en 4K multiplie le coût par 1,5x à 3x. Et les revendeurs se situent souvent entre 2x et 3x au-dessus des tarifs officiels.

💡 Vérifiez la disponibilité avant de budgétiser. L’API Sora 2 d’OpenAI devait être arrêtée le 24 septembre 2026. Sora 2 apparaît toujours dans les catalogues de modèles, donc vérifiez où il tourne avant de bâtir un pipeline dessus.

Vue en contre-plongée d’une caméra de cinéma sur trépied dans un petit studio, à côté d’une softbox

Tarifs de la voix et de la parole

La parole est la modalité la moins chère, donc la qualité et la prise en charge des langues comptent généralement davantage que le prix.

Pour 1 000 caractères, en comparaison

ModèlePrixRemarques
Inworld TTS (gamme précédente)$0,005 standard, $0,01 MaxPar million : $5 et $10
Gemini Flash TTSEnviron $0,00225 pour 10 secondesLe niveau Flash le plus récent de Google, facturé sur les tokens audio
ElevenLabs Flash and Turbo$0,04Niveau à faible latence
MiniMax Speech 2.8 Turbo$0,06Par million : $60
ElevenLabs v3$0,08Niveau expressif
ElevenLabs v2 Multilingual$0,08Plus de 30 langues
MiniMax Speech 2.8 HD$0,10Par million : $100

Une narration de dix minutes représente environ 9 000 caractères. Cela coûte à peu près $0,09 sur le niveau Max d’Inworld, $0,14 sur Gemini Flash TTS, $0,36 sur ElevenLabs Flash, $0,54 sur MiniMax Turbo, $0,72 sur ElevenLabs v3 et $0,90 sur MiniMax HD. Cent narrations de ce type sur l’option la plus chère totalisent $90. La facturation à l’audio-token et la facturation au caractère ne se convertissent pas parfaitement, donc testez avec la longueur de votre propre script.

ElevenLabs v4 est affiché à $0,08 pour 1 000 caractères et v4 Turbo à $0,04, avec une remise de lancement de 72 % qui prend fin le 12 octobre. Les chiffres d’Inworld proviennent de sa gamme TTS-1 précédente ; vérifiez donc les modèles 1.5 avant de vous y fier.

Profil d’une femme parlant dans un micro à condensateur de studio, casque sur les oreilles

Les coûts cachés qui font exploser les budgets

Les prix affichés constituent le plancher, pas la prévision.

Nouvelles tentatives, limites et sorties longues

  • Sorties rejetées. Si 20 % des générations sont jetées, votre prix effectif augmente de 25 %, car vous payez cinq exécutions pour en garder quatre.
  • Longueur des sorties. Les tokens de sortie coûtent 5 à 6 fois plus que ceux d’entrée, et les tokens de raisonnement comptent comme des tokens de sortie. Un modèle de « réflexion » peut gonfler la facture sans réponse visible plus longue.
  • Plafonds de concurrence. L’API de PicassoIA autorise 5 prédictions en cours simultanément par compte, et de nombreux fournisseurs relèvent leurs limites par palier de dépense. Attendre dans une file coûte du temps d’ingénierie.
  • Majorations des revendeurs. Les passerelles peuvent facturer 2x à 3x les tarifs officiels en échange d’une seule facture et d’une seule intégration.

Mains barrant des éléments sur une liste de contrôle manuscrite à côté d’un chronomètre argenté

Où se trouvent les économies

  1. Acheminez selon la difficulté. Envoyez les demandes simples vers le niveau le moins cher et ne montez de niveau qu’en cas d’échec.
  2. Traitez par lots tout ce qui peut attendre. La moitié du prix sur les tokens est la plus grosse remise unique disponible.
  3. Mettez en cache le contexte statique. Les prompts système, les chartes graphiques de marque et les documents de référence sont idéaux.
  4. Baissez la résolution pendant l’itération. La vidéo en 720p et les images en basse qualité suffisent pour les brouillons.
  5. Plafonnez la longueur des sorties. Une limite maximale de tokens empêche les générations qui s’emballent.

Ces leviers se cumulent. Une équipe qui achemine la plupart des tickets vers un petit modèle, met en cache ses instructions et traite par lots ses rapports nocturnes peut payer une fraction du prix affiché pour le même résultat, tandis qu’une équipe qui laisse tous les réglages par défaut paie le plein tarif pour tout.

Vue aérienne d’un entrepôt de distribution bien rangé avec des rangées de palettes filmées

Tester les prix sur PicassoIA

Lire une grille tarifaire indique ce que coûte un modèle. Le faire tourner indique si le résultat en vaut le coût. PicassoIA héberge plus de 120 modèles vidéo, 75 modèles de langage et 24 modèles de synthèse vocale, ainsi qu’un vaste catalogue d’images, pour que vous puissiez comparer les niveaux côte à côte avant d’en choisir un pour la production.

Lancer le même prompt deux fois

  1. Choisissez deux modèles de la même catégorie, comme Seedream 5 Pro et FLUX.2 pro.
  2. Ouvrez la page de chaque modèle et collez un prompt identique issu de votre charge de travail réelle.
  3. Alignez les réglages : format, résolution et qualité.
  4. Comparez les résultats en pleine taille, puis notez celui que vous publieriez vraiment.
  5. Divisez le prix unitaire du fournisseur par votre taux de conservation. Le modèle qui l’emporte en matière de coût par résultat retenu est votre choix réel.

Automatiser avec l’API

PicassoIA expose aussi une API pour développeurs à https://api.picassoia.com/v1, authentifiée avec un jeton Bearer qui commence par pia_sk_. Les tâches sont asynchrones : vous créez une prédiction, vous interrogez son statut et vous récupérez le résultat.

Point de terminaisonObjectif
POST /v1/models/{owner}/{name}/predictionsCréer une prédiction
GET /v1/predictions/{id}Vérifier le statut et récupérer la sortie
POST /v1/predictions/{id}/cancelAnnuler une tâche en cours
GET /v1/predictionsLister les prédictions récentes

Quatre modèles sont disponibles via l’API : PicassoIA Image, PicassoIA Image Editor Pro, PicassoIA Video et Seedance 2.5 Lite. La documentation indique actuellement que les prédictions via l’API sont gratuites et n’utilisent aucun crédit, et qu’un forfait Infinite est requis. Confirmez ces deux points sur la page de l’API avant de planifier en fonction, car les conditions des forfaits peuvent changer.

Lancer votre propre test de prix

La meilleure API d’IA est celle qui vous donne des résultats publiables à un prix que votre volume peut supporter, et seuls vos propres prompts peuvent vous dire laquelle c’est. Prenez une tâche réelle dans chaque catégorie, faites-la passer par un niveau économique puis par un niveau premium, et notez le coût par résultat retenu. Cinq minutes de test valent mieux qu’un après-midi à lire des grilles tarifaires.

Picasso IA rassemble ces modèles au même endroit, pour que vous puissiez générer des images, de la vidéo, de la voix et du texte sans ouvrir un compte distinct auprès de chaque fournisseur. Commencez avec un prompt issu de votre propre projet, essayez GPT Image 2 à côté de PicassoIA Image, et voyez quel résultat vous publieriez vraiment. Quand vous voudrez comparer davantage, parcourez toutes les options sur la page de tous les modèles.

Professionnel de la création dans un atelier-loft ensoleillé, examinant des photographies finies sur un grand écran

Partager cet article

Choisissez votre langue