Hugging Face Inference API no plano gratuito: limites e preços
Contas gratuitas do Hugging Face não listam mais créditos mensais de inferência incluídos, o PRO adiciona US$ 2,00 por US$ 9 por mês, e o Hub limita o tráfego em janelas de 5 minutos. Veja os números reais de créditos, limites de taxa, regras de cobrança e custos de endpoints dedicados.
Se você digitou Hugging Face Inference API free tier limits and pricing em uma barra de busca, provavelmente esperava uma cota mensal clara de chamadas gratuitas. O cenário em outubro de 2026 é mais matizado, e muitos fóruns e tutoriais antigos já estão desatualizados. A antiga Inference API serverless foi incorporada aos Inference Providers, e as regras de créditos, cobrança e limitação de tráfego mudaram junto.
Este artigo mostra o que uma conta gratuita pode fazer hoje, o que uma assinatura PRO acrescenta, como os limites de taxa se comportam e onde os custos reais aparecem quando você sai do playground. Todos os números vêm das páginas oficiais de preços, limites de taxa e Inference Endpoints como estavam no momento da redação, então abra a página de faturamento da sua conta antes de comprometer um orçamento.
O que o plano gratuito oferece
Resumindo: uma conta gratuita serve para testar uma ideia, não como cota de produção. Você ganha uma conta, um token de acesso, o Hub, o playground e a opção de comprar créditos quando quiser rodar tráfego real. O que você não ganha, segundo a página de preços atual, é uma franquia mensal de crédito de inferência incluído.
Créditos para contas gratuitas
No momento da redação, a página oficial de preços não lista nenhum crédito mensal incluído para usuários gratuitos. Contas gratuitas ainda podem chamar os Inference Providers, mas só depois de comprar créditos. Vários resumos de terceiros ainda citam US$ 0,10 por mês para contas gratuitas, então você verá esse valor repetido pela web. Se a página de faturamento da sua conta mostrar uma cota, confie nela. Se não mostrar nada, a cota não existe para você.
Onde entra o PRO
O PRO custa US$ 9 por mês e inclui US$ 2,00 em créditos mensais. São créditos de computação de uso geral, então também pagam Inference Endpoints, hardware de CPU e GPU atualizado para Spaces (incluindo uso de ZeroGPU além da sua cota) e Jobs. Eles são creditados todo mês e aplicados automaticamente antes de qualquer uso pago conforme o consumo.
Assentos de equipes e empresas
Organizações de Team e Enterprise recebem US$ 2,00 por assento, compartilhados entre todos os membros. Para gastar esse saldo, você precisa indicar a organização em cada requisição, seja com o cabeçalho X-HF-Bill-To, seja com o parâmetro bill_to do cliente Python. Administradores também podem definir um limite de gastos e desativar provedores específicos.
Tipo de conta
Créditos mensais incluídos
Uso extra
Gratuita
Nenhum
Sim, após comprar créditos
PRO (US$ 9 por mês)
US$ 2,00
Sim, pago conforme o consumo
Team ou Enterprise
US$ 2,00 por assento
Sim, pago conforme o consumo
💡 Dica: Os créditos se aplicam apenas a requisições roteadas pelo Hugging Face. Se você conectar sua própria conta de provedor, esse provedor cobra você diretamente e seus créditos incluídos ficam intactos.
Como a cobrança funciona por trás dos panos
O Hugging Face afirma que repassa os preços dos provedores diretamente, sem margem. O que muda é quem envia a fatura, e isso depende de como você faz a chamada.
Requisições roteadas comparadas ao seu próprio provedor
Roteada pelo Hugging Face
Sua própria conta de provedor
Quem cobra você
Hugging Face
O provedor
Créditos incluídos se aplicam
Sim
Não
Conta de provedor necessária
Não
Sim
Melhor para
Simplicidade e uma única fatura
Controle de cobrança, provedores não integrados
As requisições roteadas são o padrão. Você envia seu token do Hugging Face ao roteador, que encaminha a chamada ao provedor. O roteador fala um formato compatível com a OpenAI em router.huggingface.co/v1, então a maior parte do código de cliente OpenAI existente funciona depois que você troca a URL base e o token.
Por que o hf-inference parece diferente
O provedor hf-inference é o sucessor direto da antiga "Inference API (serverless)". Além dos créditos incluídos, você paga tempo de computação multiplicado pelo preço do hardware subjacente. Desde julho de 2025, ele se concentra principalmente em inferência em CPU: embeddings, ranqueamento de texto, classificação de texto e modelos pequenos de importância histórica, como BERT ou GPT-2. Modelos de chat grandes e geradores de imagem costumam ser servidos por provedores parceiros.
Um exemplo de custo com números reais
A documentação de preços inclui um exemplo prático. Uma requisição ao FLUX.1-dev que leva 10 segundos em uma GPU que custa US$ 0,00012 por segundo é cobrada em US$ 0,0012. Nessa taxa:
US$ 2,00 de crédito PRO pagam cerca de 1.666 imagens.
US$ 0,10 (a cota que posts antigos citam) pagariam cerca de 83 imagens.
Trate isso como ilustração. Os preços reais variam por modelo e provedor, e suas próprias requisições podem durar mais de 10 segundos. Algumas centenas de imagens de teste por mês cabem folgadamente nesse crédito, enquanto um app público atendendo usuários reais pode consumi-lo em uma tarde.
Limites de taxa e erros 429
Separado da cobrança, o Hub limita as requisições em janelas fixas de 5 minutos. Os valores abaixo vêm da tabela de setembro de 2025 na página de limites de taxa, e a documentação alerta que os números para contas anônimas e gratuitas podem mudar conforme a saúde da plataforma.
Os três grupos de requisições
O Hugging Face separa o tráfego em três grupos:
APIs do Hub: busca de modelos e datasets, criação de repositórios, gestão de usuários.
Resolvers: URLs que contêm /resolve/, que entregam arquivos de modelos e datasets para bibliotecas e apps.
Páginas: as páginas web em huggingface.co.
Plano
API
Resolvers
Páginas
Anônimo (por IP)
500
3.000
100
Gratuito
1.000
5.000
200
PRO
2.500
12.000
400
Team
3.000
20.000
400
Enterprise
6.000
50.000
600
Todos os números são requisições por 5 minutos. Para organizações, os limites se aplicam a cada membro individualmente, não ao grupo. Provedores de inferência individuais podem acrescentar limites próprios, então leia a mensagem de erro antes de decidir qual camada disse não.
Lendo os cabeçalhos RateLimit
Toda chamada limitada retorna 429 Too Many Requests. As respostas seguem o rascunho IETF para cabeçalhos de limite de taxa: RateLimit informa quantas requisições restam e os segundos até a renovação, enquanto RateLimit-Policy indica a janela, por exemplo 100 requisições por 5 minutos. Sua página de faturamento também mostra três medidores ao vivo, um por grupo, que ficam vermelhos quando você ultrapassa o limite.
A correção mais comum é quase banal: envie seu HF_TOKEN em todas as chamadas. Tráfego anônimo fica nos limites mais baixos, e uma biblioteca que esquece de repassar o token vai consumi-los rapidamente.
Um padrão de nova tentativa que funciona
A partir da versão 1.2.0, a biblioteca huggingface_hub lê o cabeçalho RateLimit em um 429 e espera exatamente esse tempo antes de tentar de novo, nos downloads de arquivos e nas chamadas paginadas à API do Hub. Para as suas próprias chamadas de inferência, um pequeno wrapper com backoff basta:
import os
import time
from huggingface_hub import InferenceClient
client = InferenceClient(token=os.environ["HF_TOKEN"])
def ask(prompt, retries=4):
for attempt in range(retries):
try:
reply = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324",
messages=[{"role": "user", "content": prompt}],
max_tokens=200,
)
return reply.choices[0].message.content
except Exception as err:
if "429" not in str(err):
raise
time.sleep(2 ** attempt)
raise RuntimeError("Still rate limited after retries")
Distribua os trabalhos em períodos mais longos, prefira URLs de Resolver a chamadas à API do Hub sempre que possível, e faça upgrade apenas quando os medidores provarem que você precisa.
Velocidade em capacidade compartilhada
Tráfego gratuito e de baixo custo costuma dividir capacidade com todo mundo, e isso aparece no tempo de resposta. As páginas de preços que consultei não publicam nenhuma garantia de latência, então meça você mesmo.
Cronometre dez requisições em horários diferentes e anote a mediana e a chamada mais lenta.
Escolha um modelo menor quando uma resposta curta bastar. Menos computação significa uma conta menor e uma resposta mais rápida.
Limite max_tokens para que um modelo tagarela não rode por 30 segundos em uma pergunta de uma linha.
Guarde em cache os prompts repetidos no seu próprio banco de dados, em vez de pagar duas vezes.
Rode os trabalhos em lote fora do horário de pico e deixe uma fila absorver a espera.
Um protótipo aguenta uma primeira resposta lenta. Um fluxo de finalização de compra não aguenta, e geralmente é nesse momento que as pessoas começam a olhar para hardware dedicado. Mantenha um pequeno registro dos seus tempos em uma planilha, porque uma mudança de preço ou uma semana movimentada são muito mais fáceis de identificar quando você tem uma referência.
Quando os Inference Endpoints compensam
Os Inference Endpoints oferecem uma máquina dedicada para um modelo. A cobrança é por minuto enquanto o endpoint está rodando ou inicializando. Endpoints pausados não custam nada, enquanto endpoints reduzidos a zero ainda consomem sua cota, então pause-os se precisar liberar a vaga.
Taxas por hora por hardware
Estes são os preços da AWS na página do Inference Endpoints:
Hardware
Memória
Taxa por hora
CPU x1 (1 vCPU)
2 GB
US$ 0,033
CPU x4 (4 vCPUs)
8 GB
US$ 0,134
GPU T4 x1
14 GB
US$ 0,50
GPU L4 x1
24 GB
US$ 0,80
GPU A10G x1
24 GB
US$ 1,00
GPU A100 x1
80 GB
US$ 2,50
GPU H200 x1
141 GB
US$ 5,00
O GCP também lista uma H100 com 80 GB a US$ 10,00 por hora.
Quanto um mês realmente custa
Multiplique a taxa pelas horas. Um endpoint ligado por 730 horas custa cerca de US$ 24 na menor CPU, US$ 365 em uma T4, US$ 730 em uma A10G e US$ 1.825 em uma A100. Se você o usar só 8 horas por dia em 22 dias úteis (176 horas), a T4 cai para cerca de US$ 88 e a A10G para US$ 176.
💡 Choque de realidade: os US$ 2,00 de crédito mensal do PRO compram cerca de quatro horas de um endpoint T4. É um orçamento de teste para experimentos, não um plano de hospedagem.
Como escolher o plano certo
Desenvolvedores solo e hobbistas
Fique na conta gratuita enquanto prototipa com modelos pequenos e o playground. Compre alguns dólares de créditos quando precisar de tráfego real e defina um limite de gastos pessoal com o qual você se sinta confortável. O PRO vale os seus US$ 9 quando você também quer os limites mais altos do Hub (2.500 requisições de API por janela, contra 1.000), os US$ 2,00 de crédito de computação e respostas de suporte mais rápidas.
Equipes pequenas e startups
Os planos de equipe reúnem US$ 2,00 por assento e permitem cobrança centralizada pelo cabeçalho X-HF-Bill-To, então uma única fatura paga os tokens de todos. Defina o limite de gastos no primeiro dia e desative os provedores que você não usa. O Enterprise acrescenta um endpoint para extrair o uso como uma série diária, detalhada por membro, modelo e provedor, com requisições aparecendo até 2 horas depois de feitas.
Estudantes e pesquisadores
Orçamentos acadêmicos são apertados, então combine suas ferramentas. Use o Hub para downloads, onde usuários gratuitos têm o limite mais alto, com 5.000 requisições de Resolver por 5 minutos, rode pequenos experimentos em hardware local e compre créditos apenas para a avaliação final. Organizações Academia Hub recebem limites de nível Team: 3.000 de API, 20.000 de Resolver e 400 de páginas.
Acompanhe os gastos antes que eles te surpreendam. A página de configurações dos Inference Providers mostra o uso do mês passado por modelo e provedor, enquanto a página de faturamento mostra os créditos e os medidores de limite de taxa. Confira os dois uma vez por semana.
O GPT OSS 120B é um modelo de pesos abertos de 120 bilhões de parâmetros para escrita, resumos, perguntas e respostas e código. As configurações abaixo são as que a página dele expõe:
Abra a página do GPT OSS 120B e encontre o campo Prompt.
Digite uma instrução específica. Indique o formato, o público e o tamanho que você quer.
Mantenha a Temperature no padrão de 0.1 para respostas focadas e factuais, e aumente-a quando quiser uma redação mais variada.
Deixe o Max Tokens em 2048, o limite padrão de saída, ou reduza-o para respostas curtas.
Mexa em Top P, Presence Penalty e Frequency Penalty só se uma resposta longa começar a entrar em loop ou soar monótona.
Rode o modelo, leia o resultado e depois refine o prompt e rode de novo.
Configuração
Padrão
O que muda
Temperature
0.1
Redação focada versus variada
Top P
1
Quão amplamente o modelo amostra o vocabulário
Max Tokens
2048
Limite de tamanho da resposta
Presence Penalty
0
Empurra o modelo para tópicos novos
Frequency Penalty
0
Reduz palavras e frases repetidas
💡 Dica: Use o modelo de linguagem para escrever seus prompts de imagem e depois cole-os em um modelo de texto para imagem. Uma única aba do navegador cuida do rascunho e da imagem.
A mesma conta também dá acesso às categorias de imagem e vídeo. Para imagens estáticas, experimente o FLUX 2 Pro, o Seedream 4.5, o Imagen 4 Fast, o P-Image ou o FLUX Dev, da mesma família usada no exemplo de preços acima. Para movimento, o Wan 2.6 T2V, o Veo 3.1 Fast e o Seedance 2.0 transformam um prompt de texto em um clipe, e o PicassoIA Video aparece listado como gerador gratuito e ilimitado a partir de texto ou imagem.
Crie suas próprias imagens hoje
Ler tabelas de preços é útil, mas nada supera rodar um prompt e ver o que volta. Abra o PicassoIA, escreva um briefing curto para uma foto de produto, uma paisagem ou um retrato, e deixe um modelo de texto para imagem renderizá-lo. Depois, peça ao GPT OSS 120B para reescrever seu prompt em três climas diferentes e compare os resultados lado a lado.
Você não precisa de token, saldo de créditos nem de um loop de novas tentativas para começar. Escolha um modelo no catálogo completo, teste alguns prompts e guarde os que te surpreenderem. Sua primeira imagem está a poucos minutos de distância.