Tarifs fal.ai : coûts de l’API, crédits gratuits et MCP
fal.ai facture à la sortie : quelques centimes par image, des dollars par heure de GPU et jusqu’à 0,40 $ par seconde de vidéo, le tout réglé avec des crédits prépayés. Cet article récapitule les tarifs actuels, explique l’expiration des crédits et la limite de 2 requêtes simultanées, détaille le coût du serveur MCP et compare le calcul avec un forfait fixe.
La plupart des pages tarifaires indiquent le coût d’une seule exécution. Les questions qui déterminent votre budget viennent juste après : combien d’exécutions tiennent dans un mois, ce qui arrive aux crédits gratuits que vous n’utilisez jamais, et si le serveur MCP ajoute des frais en plus du modèle. Cet article rassemble au même endroit les tarifs publiés de fal.ai, vérifiés entre le 23 septembre et le 8 octobre 2026, et effectue les calculs pour que vous puissiez chiffrer un projet réel avant de dépenser le moindre centime.
En bref : fal.ai fonctionne avec des crédits prépayés et facture à la sortie. Les images coûtent de 0,003 $ par mégapixel jusqu’à 0,15 $ par image, la vidéo de quelques centimes à 0,40 $ par seconde, les GPU se louent à l’heure, et le serveur MCP lui-même est gratuit. Vous ne payez que les exécutions qu’il déclenche, aux mêmes tarifs qu’un appel API direct.
💡 Les prix évoluent. Considérez chaque chiffre de cet article comme un instantané. Une page de modèle, ou l’outil get_pricing à l’intérieur du serveur MCP, affiche le tarif en vigueur avant que vous engagiez un budget.
Comment fal.ai vous facture
Crédits prépayés, facturation à la sortie
fal fonctionne avec un modèle de crédits prépayés. Ses conditions indiquent que vous achetez des crédits à l’avance, et que chaque exécution, via l’interface web ou un appel API, déduit son coût de votre solde. Le montant facturé dépend de ce que produit le modèle :
Sortie
Unité de facturation
Exemple tiré de la page tarifaire
Images
Par image ou par mégapixel
0,0398 $ par image (Nano Banana)
Vidéo
Par seconde, ou par vidéo
0,14 $ par seconde (Kling Video v3)
Langage et autres modèles
Par requête ou par seconde de calcul
Variable selon le modèle
Calcul brut
Par heure de GPU
De 2,49 $ à 4,50 $ pour un H100
Pensez-y comme à un compteur de services publics, pas comme à un abonnement. Rien ne tourne, rien n’est facturé. La formulation de fal est que vous ne payez que la puissance de calcul que vous consommez, et la documentation précise que vous payez les sorties réussies, jamais le temps passé en file d’attente.
Simultanéité et exécutions échouées
Deux règles influencent le coût réel bien plus que le tarif affiché en gros titre.
La simultanéité commence à 2. Un nouveau compte peut avoir 2 requêtes en cours en même temps. La limite augmente automatiquement à mesure que vous achetez des crédits, jusqu’à 40. Au-delà, il faut contacter le service commercial.
Les erreurs sont en grande partie gratuites. Les erreurs serveur (HTTP 500 et plus) ne sont jamais facturées. Une erreur client (HTTP 422) peut être facturée si le GPU avait déjà commencé à travailler avant que le problème ne soit détecté. Le temps de démarrage à froid sur les API de modèles n’est pas facturé, vous ne payez donc que le temps d’inférence.
Une autre règle pèse en production. Lorsque votre solde passe sous le seuil de blocage du compte, le compte est bloqué et les requêtes API sont rejetées tant que vous n’ajoutez pas de crédits. Si une application sert des clients, réglez un rappel de recharge bien au-dessus de ce seuil.
Tarifs des images par exécution
Modèles économiques, tarifés au mégapixel
Les modèles d’image économiques se facturent selon la résolution. Une image de 1024 × 1024 pixels représente environ 1,05 mégapixel (MP), et une image de 1920 × 1080 environ 2,07 MP.
Les deux premières lignes proviennent de la page tarifaire de fal. Les deux dernières proviennent d’un comparatif de prix daté du 23 septembre 2026. À 0,003 $ par MP, 1 000 images carrées coûtent environ 3 $.
Modèles haut de gamme, tarifés par image
Les modèles haut de gamme renoncent au calcul au mégapixel et facturent un montant fixe par image. Certains ajoutent un niveau de qualité.
💡 GPT Image 2 seul voit son prix multiplié par environ 35 entre son réglage faible et son réglage élevé. Choisissez le niveau pour chaque tâche : brouillons en faible, versions finales en élevée.
Tarifs vidéo par seconde
Comparaison des tarifs à la seconde
La vidéo est le poste qui fait grimper la facture, car vous payez chaque seconde de chaque tentative, y compris celles que vous jetez. Ces tarifs en 720p proviennent du comparatif du 23 septembre, avec et sans audio généré :
La page tarifaire de fal elle-même indique Kling Video v3 à 0,14 $ par seconde et Kling v2.5 à 0,07 $, ce qui se situe dans la même fourchette que les niveaux Standard et Pro ci-dessus. Seedance 2.0 est facturé au token (0,014 $ pour 1 000 tokens), donc chaque chiffre par seconde le concernant est une estimation qui varie avec la résolution et la durée.
💡 L’audio n’est pas gratuit. Il double le tarif de Veo 3.1, qui passe de 0,20 $ à 0,40 $ par seconde, et augmente de deux tiers celui de Veo 3.1 Lite. Si la bande sonore vient d’ailleurs, générez sans son.
Trois budgets mensuels
Voici ce que représentent les tarifs ci-dessus pour des charges de travail réelles :
100 clips de 5 secondes sur Kling v3. À 0,14 $ par seconde, chaque clip coûte 0,70 $, donc le mois revient à 70 $.
Un clip de 8 secondes avec audio. Sur Veo 3.1, cela fait 8 × 0,40 $ = 3,20 $. Sur Veo 3.1 Lite, cela fait 8 × 0,05 $ = 0,40 $, huit fois moins cher.
1 000 clips de 5 secondes avec audio sur Veo 3.1 Fast. Chaque clip coûte 0,75 $, donc le mois revient à 750 $.
Les nouvelles tentatives sont le multiplicateur caché. Si un clip sur trois est inutilisable, votre coût réel par clip retenu est supérieur de 50 % à ce que indique le tableau.
Tarifs horaires des GPU
Quand aucun modèle hébergé ne convient, fal loue des GPU à l’heure. La page tarifaire indique une fourchette pour chaque carte :
GPU
Mémoire
Tarif horaire
RTX PRO 6000
96 Go
De 1,99 $ à 4,00 $
H100
80 Go
De 2,49 $ à 4,50 $
H200
141 Go
De 2,99 $ à 6,00 $
B200
192 Go
De 5,49 $ à 7,99 $
GB200
192 Go
De 5,89 $ à 9,99 $
B300
288 Go
De 5,99 $ à 12,99 $
Une tâche de 8 heures sur un seul H100 coûte entre 19,92 $ et 36 $. Si cette même carte tourne en permanence pendant un mois de 730 heures, la facture atteint 1 817,70 $ au plus bas de la fourchette et 3 285 $ au plus haut.
Comparez avec la tarification par exécution. Sur le seul prix, un H100 allumé en permanence à 2,49 $ par heure ne l’emporte sur FLUX.1 schnell à 0,003 $ par image qu’au-delà d’environ 600 000 images d’un mégapixel par mois. En dessous, la facturation par exécution l’emporte, et elle ne demande personne pour surveiller une machine inactive.
Crédits gratuits et expiration
Ce que reçoit un nouveau compte
fal offre aux nouveaux comptes des crédits de départ pour tester, mais la page tarifaire et la documentation ne publient aucun montant. Des pages tierces décrivent une offre limitée à un certain nombre de générations avant l’ajout d’un moyen de paiement, et ce chiffre varie selon les promotions. Partez du principe que l’offre sera modeste.
Pour voir jusqu’où va un dollar aux tarifs ci-dessus :
Environ 333 images d’un mégapixel sur FLUX.1 schnell
💡 Dépensez vos crédits d’essai sur le modèle que vous mettriez réellement en production, pas sur le moins cher. Un test sur un modèle économique ne vous dit rien du coût d’un modèle haut de gamme.
Quand les crédits expirent
Les règles d’expiration diffèrent selon le type de crédit, et les deux pages officielles ne concordent pas pour les crédits promotionnels.
Type de crédit
Expiration
Remboursable
Achetés
365 jours après l’achat
Non, selon les conditions
Gratuits ou promotionnels
90 jours selon les conditions, de 1 semaine à 1 an selon la FAQ
Sans objet
La FAQ indique que les crédits gratuits et les coupons ont une durée de validité variable selon l’attribution précise. Les conditions indiquent que les crédits promotionnels expirent au bout de 90 jours. Lisez la date de votre propre attribution dans le tableau de bord de facturation, et n’achetez pas un solde important que vous ne pourrez pas dépenser en un an, car les crédits achetés ne servent qu’à la consommation et ne sont pas remboursables.
Ce que coûte le serveur MCP de fal
Le connecter
Rien. fal le précise clairement : le serveur MCP est gratuit, et vous ne payez que les exécutions de modèles que vous déclenchez, au tarif fal standard. Les mêmes limites de simultanéité s’appliquent que pour les appels API directs, et le serveur est sans état, il ne conserve donc rien entre les requêtes.
Il existe deux points d’entrée documentés. L’adresse https://mcp.fal.ai/mcp accepte un jeton d’accès dans l’en-tête Authorization. L’adresse https://mcp.fal.ai/mcp-relay utilise une connexion via le navigateur, aucun jeton n’est donc nécessaire. Une configuration client type ressemble à ceci :
Il fonctionne avec Claude Code, Claude Desktop, Cursor, Windsurf, ChatGPT et Codex CLI. L’assistant qui se cache derrière peut être un modèle comme Claude Sonnet 5 ou Gemini 3.5 Flash. Le modèle avec lequel vous discutez se facture séparément des exécutions fal qu’il déclenche.
Des outils pour plafonner vos dépenses
Le serveur expose une dizaine d’outils. Quatre comptent pour le contrôle des coûts :
Outil
Ce qu’il apporte à votre budget
get_pricing
Affiche le prix d’un modèle avant la génération
recommend_model
Suggère un modèle pour la tâche que vous décrivez
run_model
Lance un modèle et attend jusqu’à 45 secondes le résultat
submit_job et check_job
Mettent en file les longues tâches et en interrogent l’état sans bloquer
Un agent peut enchaîner une douzaine d’exécutions à partir d’une seule phrase, et chacune est facturée. Deux réflexes assurent la sécurité. Demandez à l’assistant d’appeler get_pricing en premier et de vous demander confirmation avant toute exécution au-dessus d’un seuil que vous fixez. Et gardez un solde prépayé modeste, car un compte prépayé constitue un plafond de dépenses strict : une fois l’argent épuisé, le compte se bloque.
Une alternative au forfait
La facturation par exécution récompense un usage léger et pénalise l’expérimentation. Le modèle inverse est un forfait offrant des générations généreuses, voire illimitées, sur certains modèles, et c’est l’approche de Picasso IA. Sa page tarifaire indique des générations illimitées pour PicassoIA Image sur ses formules payantes, une utilisation illimitée de PicassoIA Video sur les formules Elite et Infinite, et une utilisation illimitée promotionnelle de Seedance 2.5 Lite sur ces deux mêmes formules.
Modèles et limites
PicassoIA propose aussi une API pour développeurs et un connecteur MCP pour Claude et ChatGPT. Quatre modèles sont disponibles par les deux voies :
Un compte peut avoir 5 prédictions en file d’attente ou en cours en même temps, partagées entre ses jetons API et ses connexions MCP. Les corps de requête sont limités à 10 Mo et les prompts à 4 000 caractères. La référence de l’API indique que les prédictions API sont actuellement gratuites et ne consomment aucun crédit, mais précise aussi que la création de prédictions nécessite une formule Infinite, alors que la page tarifaire mentionne également l’accès API et les connexions MCP sur Elite. Vérifiez le tableau des formules avant de vous y fier.
Appeler l’API
Le flux se déroule en trois temps : créer, interroger, récupérer. Remplacez le jeton par votre propre valeur pia_sk_ :
curl -s -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image/predictions \
-H "Authorization: Bearer $PICASSOIA_TOKEN" \
-H "Content-Type: application/json" \
-d '{"input": {"prompt": "a lighthouse at sunset, oil painting", "aspect_ratio": "16:9"}}'
La réponse renvoie un id qui commence par api_, un status de starting et un eta avec un délai d’attente recommandé. Interrogez ensuite GET /v1/predictions/{id} jusqu’à ce que le statut indique succeeded, failed ou canceled. En cas de succès, output contient les URL des images. Les entrées facultatives incluent num_outputs (1 ou 2), output_format (webp, jpg ou png) et seed pour des résultats reproductibles.
Essayer sans compteur
Le moyen le plus rapide de comparer consiste à lancer deux fois le même prompt. Prenez le prompt que vous alliez envoyer à une API facturée à l’usage, collez-le dans PicassoIA Image, et voyez si le résultat est assez bon pour éviter la facture par image. Envoyez ensuite le meilleur résultat dans PicassoIA Image Editor Pro pour les retouches, et animez-le avec Seedance 2.5 Lite si vous avez besoin de mouvement avec du son.
Ouvrez Picasso IA, choisissez un modèle et créez vos propres images dès aujourd’hui. Si votre projet nécessite plus tard une API ou une connexion MCP, les mêmes modèles vous attendent derrière.