Hugging Face Inference API no plano gratuito: limites e preços

Contas gratuitas do Hugging Face não listam mais créditos mensais de inferência incluídos, o PRO adiciona US$ 2,00 por US$ 9 por mês, e o Hub limita o tráfego em janelas de 5 minutos. Veja os números reais de créditos, limites de taxa, regras de cobrança e custos de endpoints dedicados.

Hugging Face Inference API no plano gratuito: limites e preços
Cristian Da Conceicao
Fundador do Picasso IA

Se você digitou Hugging Face Inference API free tier limits and pricing em uma barra de busca, provavelmente esperava uma cota mensal clara de chamadas gratuitas. O cenário em outubro de 2026 é mais matizado, e muitos fóruns e tutoriais antigos já estão desatualizados. A antiga Inference API serverless foi incorporada aos Inference Providers, e as regras de créditos, cobrança e limitação de tráfego mudaram junto.

Este artigo mostra o que uma conta gratuita pode fazer hoje, o que uma assinatura PRO acrescenta, como os limites de taxa se comportam e onde os custos reais aparecem quando você sai do playground. Todos os números vêm das páginas oficiais de preços, limites de taxa e Inference Endpoints como estavam no momento da redação, então abra a página de faturamento da sua conta antes de comprometer um orçamento.

O que o plano gratuito oferece

Vista de cima de um caderno com cálculos feitos à mão a lápis, uma calculadora e café preto ao lado de um notebook

Resumindo: uma conta gratuita serve para testar uma ideia, não como cota de produção. Você ganha uma conta, um token de acesso, o Hub, o playground e a opção de comprar créditos quando quiser rodar tráfego real. O que você não ganha, segundo a página de preços atual, é uma franquia mensal de crédito de inferência incluído.

Créditos para contas gratuitas

No momento da redação, a página oficial de preços não lista nenhum crédito mensal incluído para usuários gratuitos. Contas gratuitas ainda podem chamar os Inference Providers, mas só depois de comprar créditos. Vários resumos de terceiros ainda citam US$ 0,10 por mês para contas gratuitas, então você verá esse valor repetido pela web. Se a página de faturamento da sua conta mostrar uma cota, confie nela. Se não mostrar nada, a cota não existe para você.

Onde entra o PRO

O PRO custa US$ 9 por mês e inclui US$ 2,00 em créditos mensais. São créditos de computação de uso geral, então também pagam Inference Endpoints, hardware de CPU e GPU atualizado para Spaces (incluindo uso de ZeroGPU além da sua cota) e Jobs. Eles são creditados todo mês e aplicados automaticamente antes de qualquer uso pago conforme o consumo.

Assentos de equipes e empresas

Organizações de Team e Enterprise recebem US$ 2,00 por assento, compartilhados entre todos os membros. Para gastar esse saldo, você precisa indicar a organização em cada requisição, seja com o cabeçalho X-HF-Bill-To, seja com o parâmetro bill_to do cliente Python. Administradores também podem definir um limite de gastos e desativar provedores específicos.

Tipo de contaCréditos mensais incluídosUso extra
GratuitaNenhumSim, após comprar créditos
PRO (US$ 9 por mês)US$ 2,00Sim, pago conforme o consumo
Team ou EnterpriseUS$ 2,00 por assentoSim, pago conforme o consumo

💡 Dica: Os créditos se aplicam apenas a requisições roteadas pelo Hugging Face. Se você conectar sua própria conta de provedor, esse provedor cobra você diretamente e seus créditos incluídos ficam intactos.

Como a cobrança funciona por trás dos panos

Vista em ângulo baixo de um corredor de data center entre fileiras de racks de servidores pretos com feixes de cabos organizados no alto

O Hugging Face afirma que repassa os preços dos provedores diretamente, sem margem. O que muda é quem envia a fatura, e isso depende de como você faz a chamada.

Requisições roteadas comparadas ao seu próprio provedor

Roteada pelo Hugging FaceSua própria conta de provedor
Quem cobra vocêHugging FaceO provedor
Créditos incluídos se aplicamSimNão
Conta de provedor necessáriaNãoSim
Melhor paraSimplicidade e uma única faturaControle de cobrança, provedores não integrados

As requisições roteadas são o padrão. Você envia seu token do Hugging Face ao roteador, que encaminha a chamada ao provedor. O roteador fala um formato compatível com a OpenAI em router.huggingface.co/v1, então a maior parte do código de cliente OpenAI existente funciona depois que você troca a URL base e o token.

Por que o hf-inference parece diferente

O provedor hf-inference é o sucessor direto da antiga "Inference API (serverless)". Além dos créditos incluídos, você paga tempo de computação multiplicado pelo preço do hardware subjacente. Desde julho de 2025, ele se concentra principalmente em inferência em CPU: embeddings, ranqueamento de texto, classificação de texto e modelos pequenos de importância histórica, como BERT ou GPT-2. Modelos de chat grandes e geradores de imagem costumam ser servidos por provedores parceiros.

Um exemplo de custo com números reais

A documentação de preços inclui um exemplo prático. Uma requisição ao FLUX.1-dev que leva 10 segundos em uma GPU que custa US$ 0,00012 por segundo é cobrada em US$ 0,0012. Nessa taxa:

  • US$ 2,00 de crédito PRO pagam cerca de 1.666 imagens.
  • US$ 0,10 (a cota que posts antigos citam) pagariam cerca de 83 imagens.

Trate isso como ilustração. Os preços reais variam por modelo e provedor, e suas próprias requisições podem durar mais de 10 segundos. Algumas centenas de imagens de teste por mês cabem folgadamente nesse crédito, enquanto um app público atendendo usuários reais pode consumi-lo em uma tarde.

Limites de taxa e erros 429

Close-up das mãos de um desenvolvedor digitando em uma mesa, com código desfocado em um monitor ao fundo

Separado da cobrança, o Hub limita as requisições em janelas fixas de 5 minutos. Os valores abaixo vêm da tabela de setembro de 2025 na página de limites de taxa, e a documentação alerta que os números para contas anônimas e gratuitas podem mudar conforme a saúde da plataforma.

Os três grupos de requisições

O Hugging Face separa o tráfego em três grupos:

  • APIs do Hub: busca de modelos e datasets, criação de repositórios, gestão de usuários.
  • Resolvers: URLs que contêm /resolve/, que entregam arquivos de modelos e datasets para bibliotecas e apps.
  • Páginas: as páginas web em huggingface.co.
PlanoAPIResolversPáginas
Anônimo (por IP)5003.000100
Gratuito1.0005.000200
PRO2.50012.000400
Team3.00020.000400
Enterprise6.00050.000600

Todos os números são requisições por 5 minutos. Para organizações, os limites se aplicam a cada membro individualmente, não ao grupo. Provedores de inferência individuais podem acrescentar limites próprios, então leia a mensagem de erro antes de decidir qual camada disse não.

Lendo os cabeçalhos RateLimit

Toda chamada limitada retorna 429 Too Many Requests. As respostas seguem o rascunho IETF para cabeçalhos de limite de taxa: RateLimit informa quantas requisições restam e os segundos até a renovação, enquanto RateLimit-Policy indica a janela, por exemplo 100 requisições por 5 minutos. Sua página de faturamento também mostra três medidores ao vivo, um por grupo, que ficam vermelhos quando você ultrapassa o limite.

A correção mais comum é quase banal: envie seu HF_TOKEN em todas as chamadas. Tráfego anônimo fica nos limites mais baixos, e uma biblioteca que esquece de repassar o token vai consumi-los rapidamente.

Um padrão de nova tentativa que funciona

A partir da versão 1.2.0, a biblioteca huggingface_hub lê o cabeçalho RateLimit em um 429 e espera exatamente esse tempo antes de tentar de novo, nos downloads de arquivos e nas chamadas paginadas à API do Hub. Para as suas próprias chamadas de inferência, um pequeno wrapper com backoff basta:

import os
import time
from huggingface_hub import InferenceClient

client = InferenceClient(token=os.environ["HF_TOKEN"])

def ask(prompt, retries=4):
    for attempt in range(retries):
        try:
            reply = client.chat.completions.create(
                model="deepseek-ai/DeepSeek-V3-0324",
                messages=[{"role": "user", "content": prompt}],
                max_tokens=200,
            )
            return reply.choices[0].message.content
        except Exception as err:
            if "429" not in str(err):
                raise
            time.sleep(2 ** attempt)
    raise RuntimeError("Still rate limited after retries")

Distribua os trabalhos em períodos mais longos, prefira URLs de Resolver a chamadas à API do Hub sempre que possível, e faça upgrade apenas quando os medidores provarem que você precisa.

Velocidade em capacidade compartilhada

Close-up apertado de uma mão segurando um cronômetro de aço escovado sobre uma mesa de madeira

Tráfego gratuito e de baixo custo costuma dividir capacidade com todo mundo, e isso aparece no tempo de resposta. As páginas de preços que consultei não publicam nenhuma garantia de latência, então meça você mesmo.

  • Cronometre dez requisições em horários diferentes e anote a mediana e a chamada mais lenta.
  • Escolha um modelo menor quando uma resposta curta bastar. Menos computação significa uma conta menor e uma resposta mais rápida.
  • Limite max_tokens para que um modelo tagarela não rode por 30 segundos em uma pergunta de uma linha.
  • Guarde em cache os prompts repetidos no seu próprio banco de dados, em vez de pagar duas vezes.
  • Rode os trabalhos em lote fora do horário de pico e deixe uma fila absorver a espera.

Um protótipo aguenta uma primeira resposta lenta. Um fluxo de finalização de compra não aguenta, e geralmente é nesse momento que as pessoas começam a olhar para hardware dedicado. Mantenha um pequeno registro dos seus tempos em uma planilha, porque uma mudança de preço ou uma semana movimentada são muito mais fáceis de identificar quando você tem uma referência.

Quando os Inference Endpoints compensam

Técnico agachado ao lado de um servidor GPU aberto montado em rack, segurando uma lanterna e um tablet

Os Inference Endpoints oferecem uma máquina dedicada para um modelo. A cobrança é por minuto enquanto o endpoint está rodando ou inicializando. Endpoints pausados não custam nada, enquanto endpoints reduzidos a zero ainda consomem sua cota, então pause-os se precisar liberar a vaga.

Taxas por hora por hardware

Estes são os preços da AWS na página do Inference Endpoints:

HardwareMemóriaTaxa por hora
CPU x1 (1 vCPU)2 GBUS$ 0,033
CPU x4 (4 vCPUs)8 GBUS$ 0,134
GPU T4 x114 GBUS$ 0,50
GPU L4 x124 GBUS$ 0,80
GPU A10G x124 GBUS$ 1,00
GPU A100 x180 GBUS$ 2,50
GPU H200 x1141 GBUS$ 5,00

O GCP também lista uma H100 com 80 GB a US$ 10,00 por hora.

Quanto um mês realmente custa

Multiplique a taxa pelas horas. Um endpoint ligado por 730 horas custa cerca de US$ 24 na menor CPU, US$ 365 em uma T4, US$ 730 em uma A10G e US$ 1.825 em uma A100. Se você o usar só 8 horas por dia em 22 dias úteis (176 horas), a T4 cai para cerca de US$ 88 e a A10G para US$ 176.

💡 Choque de realidade: os US$ 2,00 de crédito mensal do PRO compram cerca de quatro horas de um endpoint T4. É um orçamento de teste para experimentos, não um plano de hospedagem.

Como escolher o plano certo

Desenvolvedores solo e hobbistas

Fique na conta gratuita enquanto prototipa com modelos pequenos e o playground. Compre alguns dólares de créditos quando precisar de tráfego real e defina um limite de gastos pessoal com o qual você se sinta confortável. O PRO vale os seus US$ 9 quando você também quer os limites mais altos do Hub (2.500 requisições de API por janela, contra 1.000), os US$ 2,00 de crédito de computação e respostas de suporte mais rápidas.

Equipes pequenas e startups

Quatro colegas reunidos em volta de uma longa mesa de carvalho em um espaço de coworking iluminado, olhando para um notebook

Os planos de equipe reúnem US$ 2,00 por assento e permitem cobrança centralizada pelo cabeçalho X-HF-Bill-To, então uma única fatura paga os tokens de todos. Defina o limite de gastos no primeiro dia e desative os provedores que você não usa. O Enterprise acrescenta um endpoint para extrair o uso como uma série diária, detalhada por membro, modelo e provedor, com requisições aparecendo até 2 horas depois de feitas.

Estudantes e pesquisadores

Estudante de perfil em uma longa mesa de biblioteca de madeira com notebook, livros didáticos e um marca-texto

Orçamentos acadêmicos são apertados, então combine suas ferramentas. Use o Hub para downloads, onde usuários gratuitos têm o limite mais alto, com 5.000 requisições de Resolver por 5 minutos, rode pequenos experimentos em hardware local e compre créditos apenas para a avaliação final. Organizações Academia Hub recebem limites de nível Team: 3.000 de API, 20.000 de Resolver e 400 de páginas.

Acompanhe os gastos antes que eles te surpreendam. A página de configurações dos Inference Providers mostra o uso do mês passado por modelo e provedor, enquanto a página de faturamento mostra os créditos e os medidores de limite de taxa. Confira os dois uma vez por semana.

Vista por cima do ombro de um homem em uma mesa de café observando um gráfico de barras desfocado em um notebook ao lado de um flat white

Rode os mesmos modelos no PicassoIA

Fotógrafo revisando grandes paisagens impressas de lagos de montanha em um estúdio ao entardecer

Se o seu objetivo é usar modelos de pesos abertos sem fazer malabarismo com tokens, créditos e erros 429, o PicassoIA hospeda muitos deles no navegador. A categoria de modelos de linguagem inclui o GPT OSS 120B, o Llama 4 Scout Instruct, o Qwen3 235B A22B Instruct 2507, o DeepSeek v3.1, o Kimi K2.6 e o compacto Granite 4.1 8B.

Como usar o GPT OSS no PicassoIA

O GPT OSS 120B é um modelo de pesos abertos de 120 bilhões de parâmetros para escrita, resumos, perguntas e respostas e código. As configurações abaixo são as que a página dele expõe:

  1. Abra a página do GPT OSS 120B e encontre o campo Prompt.
  2. Digite uma instrução específica. Indique o formato, o público e o tamanho que você quer.
  3. Mantenha a Temperature no padrão de 0.1 para respostas focadas e factuais, e aumente-a quando quiser uma redação mais variada.
  4. Deixe o Max Tokens em 2048, o limite padrão de saída, ou reduza-o para respostas curtas.
  5. Mexa em Top P, Presence Penalty e Frequency Penalty só se uma resposta longa começar a entrar em loop ou soar monótona.
  6. Rode o modelo, leia o resultado e depois refine o prompt e rode de novo.
ConfiguraçãoPadrãoO que muda
Temperature0.1Redação focada versus variada
Top P1Quão amplamente o modelo amostra o vocabulário
Max Tokens2048Limite de tamanho da resposta
Presence Penalty0Empurra o modelo para tópicos novos
Frequency Penalty0Reduz palavras e frases repetidas

💡 Dica: Use o modelo de linguagem para escrever seus prompts de imagem e depois cole-os em um modelo de texto para imagem. Uma única aba do navegador cuida do rascunho e da imagem.

A mesma conta também dá acesso às categorias de imagem e vídeo. Para imagens estáticas, experimente o FLUX 2 Pro, o Seedream 4.5, o Imagen 4 Fast, o P-Image ou o FLUX Dev, da mesma família usada no exemplo de preços acima. Para movimento, o Wan 2.6 T2V, o Veo 3.1 Fast e o Seedance 2.0 transformam um prompt de texto em um clipe, e o PicassoIA Video aparece listado como gerador gratuito e ilimitado a partir de texto ou imagem.

Crie suas próprias imagens hoje

Ler tabelas de preços é útil, mas nada supera rodar um prompt e ver o que volta. Abra o PicassoIA, escreva um briefing curto para uma foto de produto, uma paisagem ou um retrato, e deixe um modelo de texto para imagem renderizá-lo. Depois, peça ao GPT OSS 120B para reescrever seu prompt em três climas diferentes e compare os resultados lado a lado.

Você não precisa de token, saldo de créditos nem de um loop de novas tentativas para começar. Escolha um modelo no catálogo completo, teste alguns prompts e guarde os que te surpreenderem. Sua primeira imagem está a poucos minutos de distância.

Compartilhe este artigo

Escolha seu idioma