Hugging Face Inference API, offre gratuite : limites et tarifs
Les comptes Hugging Face gratuits ne listent plus de crédits d’inférence mensuels inclus, PRO ajoute 2,00 $ pour 9 $ par mois, et le Hub limite le trafic par fenêtres de 5 minutes. Voici les chiffres réels : crédits, limites de débit, règles de facturation et coût des endpoints dédiés.
Si vous avez tapé limites et tarifs de l’offre gratuite de l’API d’inférence Hugging Face dans une barre de recherche, vous espériez sans doute un quota mensuel clair d’appels gratuits. La situation en octobre 2026 est plus nuancée, et bon nombre de fils de forum et de tutoriels anciens sont désormais dépassés. L’ancienne API d’inférence serverless a été intégrée à Inference Providers, et les règles de crédits, de facturation et de limitation de débit ont suivi.
Cet article fait le point sur ce qu’un compte gratuit peut faire aujourd’hui, ce qu’apporte un abonnement PRO, le fonctionnement des limites de débit, et l’endroit où les coûts réels apparaissent une fois que vous quittez le bac à sable. Tous les chiffres proviennent des pages officielles de tarification, des limites de débit et d’Inference Endpoints telles qu’elles étaient au moment de la rédaction. Consultez donc la page de facturation de votre propre compte avant d’engager un budget.
Ce que donne l’offre gratuite
En bref, un compte gratuit sert à tester une idée, pas à alimenter une production. Vous obtenez un compte, un token d’accès, le Hub, le bac à sable et la possibilité d’acheter des crédits lorsque vous voulez faire tourner un trafic réel. Ce que vous n’obtenez pas, selon la page de tarification actuelle, c’est une enveloppe mensuelle de crédits d’inférence inclus.
Crédits pour les comptes gratuits
Au moment de la rédaction, la page de tarification officielle n’indique aucun crédit mensuel inclus pour les utilisateurs gratuits. Les comptes gratuits peuvent tout de même appeler Inference Providers, mais seulement après l’achat de crédits. Plusieurs synthèses tierces citent encore 0,10 $ par mois pour les comptes gratuits, si bien que ce chiffre circule toujours sur le web. Si la page de facturation de votre compte affiche une allocation, fiez-vous à elle. Si elle n’affiche rien, c’est que l’allocation n’existe plus pour vous.
La place de PRO
PRO coûte 9 $ par mois et inclut 2,00 $ de crédits mensuels. Il s’agit de crédits de calcul polyvalents, qui paient donc aussi les Inference Endpoints, le matériel CPU et GPU amélioré pour les Spaces (y compris l’usage de ZeroGPU au-delà de votre quota) et les Jobs. Ils sont crédités chaque mois et appliqués automatiquement avant toute facturation à l’usage.
Sièges Team et Enterprise
Les organisations Team et Enterprise reçoivent 2,00 $ par siège, mis en commun entre tous les membres. Pour dépenser ce pool, vous devez indiquer l’organisation dans chaque requête, soit avec l’en-tête X-HF-Bill-To, soit avec le paramètre bill_to du client Python. Les administrateurs peuvent aussi définir un plafond de dépenses et désactiver certains fournisseurs.
Type de compte
Crédits mensuels inclus
Usage supplémentaire
Gratuit
Aucun
Oui, après achat de crédits
PRO (9 $ par mois)
2,00 $
Oui, à l’usage
Team ou Enterprise
2,00 $ par siège
Oui, à l’usage
💡 Astuce : les crédits ne s’appliquent qu’aux requêtes acheminées par Hugging Face. Si vous branchez votre propre compte chez un fournisseur, c’est ce fournisseur qui vous facture directement, et vos crédits inclus restent intacts.
Comment fonctionne la facturation en coulisses
Hugging Face indique répercuter les prix des fournisseurs sans aucune marge. Ce qui change, c’est la personne qui envoie la facture, et cela dépend de la façon dont vous passez l’appel.
Requêtes acheminées ou votre propre fournisseur
Acheminé par Hugging Face
Votre propre compte fournisseur
Qui vous facture
Hugging Face
Le fournisseur
Crédits inclus applicables
Oui
Non
Compte fournisseur requis
Non
Oui
Idéal pour
La simplicité et une seule facture
Le contrôle de la facturation, fournisseurs non intégrés
Les requêtes acheminées sont le mode par défaut. Vous envoyez votre token Hugging Face au routeur, qui transmet l’appel au fournisseur. Le routeur parle un format compatible OpenAI à router.huggingface.co/v1, si bien que la plupart du code client OpenAI existant fonctionne après avoir modifié l’URL de base et le token.
Pourquoi hf-inference paraît différent
Le fournisseur hf-inference est le successeur direct de l’ancienne « Inference API (serverless) ». Au-delà de vos crédits inclus, vous payez le temps de calcul multiplié par le prix du matériel sous-jacent. Depuis juillet 2025, il se concentre surtout sur l’inférence CPU : embeddings, classement de texte, classification de texte et petits modèles d’importance historique comme BERT ou GPT-2. Les grands modèles de conversation et les générateurs d’images sont en général servis par des fournisseurs partenaires.
Un exemple de coût avec des chiffres réels
La documentation de tarification contient un exemple détaillé. Une requête vers FLUX.1-dev qui dure 10 secondes sur un GPU facturé 0,00012 $ par seconde est facturée 0,0012 $. À ce tarif :
2,00 $ de crédit PRO paie environ 1 666 images.
0,10 $ (l’enveloppe que mentionnent les anciens articles) auraient payé environ 83 images.
Prenez cela comme une illustration. Les prix réels varient selon le modèle et le fournisseur, et vos requêtes peuvent durer plus de 10 secondes. Quelques centaines d’images de test par mois tiennent confortablement dans ce crédit, alors qu’une application publique servant de vrais utilisateurs peut le consommer en un après-midi.
Limites de débit et erreurs 429
Indépendamment de la facturation, le Hub limite les requêtes par fenêtres fixes de 5 minutes. Les valeurs ci-dessous proviennent du tableau de septembre 2025 de la page des limites de débit, et la documentation signale que les chiffres pour les usages anonymes et gratuits peuvent changer selon l’état de la plateforme.
Les trois catégories de requêtes
Hugging Face répartit le trafic en trois catégories :
API du Hub : recherche de modèles et de jeux de données, création de dépôts, gestion des utilisateurs.
Resolvers : URL contenant /resolve/, qui servent les fichiers de modèles et de jeux de données aux bibliothèques et aux applications.
Pages : les pages web de huggingface.co.
Offre
API
Resolvers
Pages
Anonyme (par IP)
500
3 000
100
Gratuit
1 000
5 000
200
PRO
2 500
12 000
400
Team
3 000
20 000
400
Enterprise
6 000
50 000
600
Tous les chiffres sont des requêtes par 5 minutes. Pour les organisations, les limites s’appliquent à chaque membre individuellement, et non au groupe. Certains fournisseurs d’inférence peuvent ajouter leurs propres limites, alors lisez le corps de l’erreur avant de décider quelle couche a refusé la requête.
Lire les en-têtes RateLimit
Chaque appel limité renvoie 429 Too Many Requests. Les réponses suivent le brouillon IETF pour les en-têtes de limite de débit : RateLimit indique combien de requêtes restent et le nombre de secondes avant la réinitialisation, tandis que RateLimit-Policy précise la fenêtre, par exemple 100 requêtes par 5 minutes. Votre page de facturation affiche aussi trois jauges en direct, une par catégorie, qui deviennent rouges lorsque vous franchissez la limite.
La solution la plus courante est presque banale : transmettez votre HF_TOKEN partout. Le trafic anonyme est au niveau de limite le plus bas, et une bibliothèque qui oublie de transmettre le token épuisera ces limites très vite.
Un schéma de nouvelle tentative qui fonctionne
À partir de la version 1.2.0, la bibliothèque huggingface_hub lit l’en-tête RateLimit lors d’une erreur 429 et attend exactement ce délai avant de réessayer, pour les téléchargements de fichiers et les appels paginés à l’API du Hub. Pour vos propres appels d’inférence, un petit wrapper avec backoff suffit :
import os
import time
from huggingface_hub import InferenceClient
client = InferenceClient(token=os.environ["HF_TOKEN"])
def ask(prompt, retries=4):
for attempt in range(retries):
try:
reply = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324",
messages=[{"role": "user", "content": prompt}],
max_tokens=200,
)
return reply.choices[0].message.content
except Exception as err:
if "429" not in str(err):
raise
time.sleep(2 ** attempt)
raise RuntimeError("Still rate limited after retries")
Répartissez vos tâches sur des périodes plus longues, privilégiez les URL Resolver aux appels à l’API du Hub lorsque c’est possible, et ne montez en gamme que lorsque les jauges prouvent que vous en avez besoin.
La vitesse sur une capacité partagée
Le trafic gratuit et à petit coût partage en général sa capacité avec tous les autres, et cela se voit dans le temps de réponse. Les pages de tarification que j’ai consultées ne publient aucune garantie de latence, mesurez donc la vôtre.
Chronométrez dix requêtes à des heures différentes et notez la médiane et l’appel le plus lent.
Choisissez un modèle plus petit lorsqu’une réponse courte suffit. Moins de calcul signifie une facture plus légère et une réponse plus rapide.
Plafonnez max_tokens pour qu’un modèle bavard ne tourne pas 30 secondes sur une question d’une ligne.
Mettez en cache les prompts répétés dans votre propre base de données au lieu de payer deux fois.
Lancez les traitements en masse hors pointe et laissez une file d’attente absorber l’attente.
Un prototype peut s’accommoder d’une première réponse lente. Un parcours de paiement, lui, ne le peut pas, et c’est généralement à ce moment-là que l’on commence à regarder du matériel dédié. Tenez un petit journal de vos temps de réponse dans un tableur, car un changement de tarif ou une semaine chargée se repèrent beaucoup plus facilement lorsque vous disposez d’une référence.
Quand les Inference Endpoints sont rentables
Les Inference Endpoints vous donnent une machine dédiée à un seul modèle. La facturation se fait à la minute tant que l’endpoint tourne ou s’initialise. Les endpoints en pause ne coûtent rien, tandis que les endpoints réduits à zéro comptent toujours dans votre quota, donc mettez-les en pause si vous avez besoin de récupérer la place.
Tarifs horaires par matériel
Voici les prix AWS indiqués sur la page Inference Endpoints :
Matériel
Mémoire
Tarif horaire
CPU x1 (1 vCPU)
2 Go
0,033 $
CPU x4 (4 vCPU)
8 Go
0,134 $
GPU T4 x1
14 Go
0,50 $
GPU L4 x1
24 Go
0,80 $
GPU A10G x1
24 Go
1,00 $
GPU A100 x1
80 Go
2,50 $
GPU H200 x1
141 Go
5,00 $
GCP propose aussi un H100 de 80 Go à 10,00 $ de l’heure.
Ce que coûte réellement un mois
Multipliez le tarif par le nombre d’heures. Un endpoint laissé allumé 730 heures coûte environ 24 $ sur le plus petit CPU, 365 $ sur un T4, 730 $ sur un A10G et 1 825 $ sur un A100. Si vous ne le faites tourner que 8 heures par jour sur 22 jours ouvrés (176 heures), le T4 descend à environ 88 $ et le A10G à 176 $.
💡 Retour à la réalité : le crédit PRO mensuel de 2,00 $ permet d’acheter environ quatre heures d’un endpoint T4. C’est un budget d’essai pour des expériences, pas un plan d’hébergement.
Choisir la bonne offre
Développeurs solo et amateurs
Restez sur le compte gratuit pendant que vous prototypez avec de petits modèles et le bac à sable. Achetez quelques dollars de crédits lorsque vous avez besoin d’un trafic réel, et fixez-vous un plafond de dépenses personnel qui vous convient. PRO se justifie à 9 $ lorsque vous voulez aussi les limites plus élevées du Hub (2 500 requêtes API par fenêtre contre 1 000), les 2,00 $ de crédit de calcul et un support plus réactif.
Petites équipes et startups
Les offres Team mettent en commun 2,00 $ par siège et permettent une facturation centralisée grâce à l’en-tête X-HF-Bill-To, si bien qu’une seule facture couvre les tokens de tout le monde. Définissez le plafond de dépenses dès le premier jour et désactivez les fournisseurs que vous n’utilisez pas. Enterprise ajoute un point de terminaison permettant d’extraire l’usage sous forme de série quotidienne ventilée par membre, modèle et fournisseur, les requêtes apparaissant jusqu’à 2 heures après leur envoi.
Étudiants et chercheurs
Les budgets universitaires sont serrés, alors combinez vos outils. Utilisez le Hub pour les téléchargements, où les utilisateurs gratuits bénéficient de la catégorie la plus élevée, avec 5 000 requêtes Resolver par 5 minutes, menez les petites expériences sur du matériel local, et n’achetez des crédits que pour l’évaluation finale. Les organisations Academia Hub bénéficient de limites de niveau Team, soit 3 000 requêtes API, 20 000 Resolver et 400 pages.
Suivez vos dépenses avant qu’elles ne vous surprennent. La page des paramètres Inference Providers affiche l’usage du mois dernier par modèle et par fournisseur, tandis que la page de facturation affiche les crédits et les jauges de limite de débit. Consultez les deux une fois par semaine.
GPT OSS 120B est un modèle à poids ouverts de 120 milliards de paramètres, destiné à l’écriture, aux résumés, aux questions-réponses et au code. Les réglages ci-dessous sont ceux que sa page expose :
Ouvrez la page de GPT OSS 120B et repérez le champ Prompt.
Saisissez une consigne précise. Indiquez le format, le public et la longueur souhaités.
Laissez Temperature à sa valeur par défaut de 0.1 pour des réponses ciblées et factuelles, et augmentez-la lorsque vous voulez une formulation plus variée.
Laissez Max Tokens à 2048, le plafond de sortie par défaut, ou abaissez-le pour des réponses courtes.
Ne touchez à Top P, Presence Penalty et Frequency Penalty que si une réponse longue se met à boucler ou à paraître fade.
Lancez le modèle, lisez le résultat, puis affinez le prompt et relancez.
Réglage
Valeur par défaut
Ce qu’il modifie
Temperature
0.1
Formulation ciblée ou variée
Top P
1
Largeur de l’échantillonnage du vocabulaire par le modèle
Max Tokens
2048
Plafond de longueur de la réponse
Presence Penalty
0
Pousse le modèle vers de nouveaux sujets
Frequency Penalty
0
Réduit les mots et expressions répétés
💡 Astuce : utilisez le modèle de langage pour rédiger vos prompts d’image, puis collez-les dans un modèle de texte vers image. Un seul onglet de navigateur gère le brouillon et l’image.
Le même compte donne aussi accès aux catégories image et vidéo. Pour les images fixes, essayez FLUX 2 Pro, Seedream 4.5, Imagen 4 Fast, P-Image ou FLUX Dev, la même famille que celle utilisée dans l’exemple de tarification ci-dessus. Pour le mouvement, Wan 2.6 T2V, Veo 3.1 Fast et Seedance 2.0 transforment un prompt textuel en clip, et PicassoIA Video est présenté comme un générateur gratuit et illimité à partir d’un texte ou d’une image.
Créez vos propres images dès aujourd’hui
Lire des tableaux de tarification est utile, mais rien ne vaut le fait de lancer un prompt et de voir ce qui en sort. Ouvrez PicassoIA, rédigez un bref descriptif pour une photo de produit, un paysage ou un portrait, et laissez un modèle de texte vers image en générer le rendu. Demandez ensuite à GPT OSS 120B de réécrire votre prompt dans trois ambiances différentes, puis comparez les résultats côte à côte.
Vous n’avez besoin ni de token, ni de solde de crédits, ni de boucle de nouvelles tentatives pour commencer. Choisissez un modèle dans le catalogue complet, essayez quelques prompts et gardez ceux qui vous surprennent. Votre première image est à quelques minutes seulement.