Hugging Face Inference API, plan gratuito: límites y precios

Las cuentas gratuitas de Hugging Face ya no indican créditos mensuales de inferencia incluidos, PRO añade 2,00 $ por 9 $ al mes y el Hub limita el tráfico en ventanas de 5 minutos. Consulta las cifras reales de créditos, límites de tasa, reglas de facturación y costos de los endpoints dedicados.

Hugging Face Inference API, plan gratuito: límites y precios
Cristian Da Conceicao
Fundador de Picasso IA

Si escribiste Hugging Face Inference API free tier limits and pricing en el buscador, seguramente esperabas una cuota mensual clara de llamadas gratuitas. El panorama en octubre de 2026 es más matizado, y muchos hilos de foros y tutoriales antiguos ya están desactualizados. La antigua Inference API sin servidor se integró en Inference Providers, y las reglas de créditos, facturación y limitación de tráfico cambiaron con ella.

Este artículo explica qué puede hacer hoy una cuenta gratuita, qué añade una suscripción PRO, cómo se comportan los límites de tasa y dónde aparecen los costos reales cuando sales del entorno de pruebas. Todas las cifras proceden de las páginas oficiales de precios, límites de tasa y Inference Endpoints tal como estaban en el momento de escribir, así que revisa la página de facturación de tu cuenta antes de comprometer un presupuesto.

Qué ofrece el plan gratuito

Vista cenital de una libreta con cálculos a lápiz, una calculadora y un café negro junto a un equipo portátil

La versión corta: una cuenta gratuita sirve para probar una idea, no como cuota de producción. Obtienes una cuenta, un token de acceso, el Hub, el entorno de pruebas y la opción de comprar créditos cuando quieras manejar tráfico real. Lo que no obtienes, según la página de precios actual, es un cupo mensual de créditos de inferencia incluidos.

Créditos para cuentas gratuitas

En el momento de escribir, la página oficial de precios no muestra créditos mensuales incluidos para los usuarios gratuitos. Las cuentas gratuitas pueden seguir llamando a Inference Providers, pero solo después de comprar créditos. Varios resúmenes de terceros todavía citan 0,10 $ al mes para las cuentas gratuitas, así que verás esa cifra repetida en internet. Si tu propia página de facturación muestra una cuota, confía en ella. Si no muestra nada, para ti la cuota ya no existe.

Dónde encaja PRO

PRO cuesta 9 $ al mes e incluye 2,00 $ en créditos mensuales. Son créditos de cómputo de uso general, así que también pagan los Inference Endpoints, el hardware de CPU y GPU mejorado para Spaces (incluido el uso de ZeroGPU por encima de tu cuota) y los Jobs. Se abonan cada mes y se aplican automáticamente antes de facturar cualquier uso de pago por uso.

Equipos y plazas Enterprise

Las organizaciones Team y Enterprise reciben 2,00 $ por plaza, compartidos entre todos los miembros. Para gastar ese fondo, debes indicar la organización en cada solicitud, ya sea con el encabezado X-HF-Bill-To o con el parámetro bill_to del cliente de Python. Los administradores también pueden fijar un límite de gasto y desactivar proveedores concretos.

Tipo de cuentaCréditos mensuales incluidosUso adicional
GratuitaNingunoSí, tras comprar créditos
PRO (9 $ al mes)2,00 $Sí, pago por uso
Team o Enterprise2,00 $ por plazaSí, pago por uso

💡 Consejo: Los créditos solo se aplican a las solicitudes enrutadas a través de Hugging Face. Si conectas tu propia cuenta de proveedor, ese proveedor te factura directamente y tus créditos incluidos no se tocan.

Cómo funciona la facturación por dentro

Vista en contrapicado de un pasillo de centro de datos entre filas de racks de servidores negros con haces de cables ordenados sobre la cabeza

Hugging Face afirma que traslada los precios de los proveedores tal cual, sin margen. Lo que cambia es quién envía la factura, y eso depende de cómo hagas la llamada.

Solicitudes enrutadas frente a tu propio proveedor

Enrutado por Hugging FaceTu propia cuenta de proveedor
Quién te facturaHugging FaceEl proveedor
Los créditos incluidos se aplicanSíNo
Se necesita cuenta de proveedorNoSí
Ideal paraSencillez y una sola facturaControl de facturación, proveedores no integrados

Las solicitudes enrutadas son la opción predeterminada. Envías tu token de Hugging Face al router, que reenvía la llamada al proveedor. El router habla un formato compatible con OpenAI en router.huggingface.co/v1, así que la mayoría del código de cliente de OpenAI que ya tienes funciona después de cambiar la URL base y el token.

Por qué hf-inference se ve distinto

El proveedor hf-inference es el sucesor directo de la antigua "Inference API (serverless)". Más allá de tus créditos incluidos, pagas el tiempo de cómputo multiplicado por el precio del hardware subyacente. Desde julio de 2025 se centra sobre todo en la inferencia en CPU: embeddings, ranking de texto, clasificación de texto y modelos pequeños de importancia histórica como BERT o GPT-2. Los modelos grandes de chat y los generadores de imágenes suelen servirse a través de proveedores asociados.

Un ejemplo de costo con cifras reales

La documentación de precios incluye un ejemplo resuelto. Una solicitud a FLUX.1-dev que tarda 10 segundos en una GPU con un costo de 0,00012 $ por segundo se factura a 0,0012 $. Con esa tarifa:

  • 2,00 $ de crédito PRO pagan unas 1.666 imágenes.
  • 0,10 $ (la cuota que mencionan las publicaciones antiguas) habrían pagado unas 83 imágenes.

Tómalo como una ilustración. Los precios reales varían según el modelo y el proveedor, y tus solicitudes pueden tardar más de 10 segundos. Unos cientos de imágenes de prueba al mes caben cómodamente en ese crédito, mientras que una aplicación pública con usuarios reales puede consumirlo en una tarde.

Límites de tasa y errores 429

Primer plano de las manos de un desarrollador escribiendo en un escritorio, con código desenfocado en el monitor de fondo

Aparte de la facturación, el Hub limita las solicitudes en ventanas fijas de 5 minutos. Los valores de abajo proceden de la tabla de septiembre de 2025 de la página de límites de tasa, y la documentación advierte de que las cifras para usuarios anónimos y gratuitos pueden cambiar según el estado de la plataforma.

Los tres grupos de solicitudes

Hugging Face clasifica el tráfico en tres grupos:

  • APIs del Hub: búsqueda de modelos y datasets, creación de repositorios y gestión de usuarios.
  • Resolvers: URL que contienen /resolve/, que sirven archivos de modelos y datasets a bibliotecas y aplicaciones.
  • Páginas: las páginas web de huggingface.co.
PlanAPIResolversPáginas
Anónimo (por IP)5003.000100
Gratuito1.0005.000200
PRO2.50012.000400
Team3.00020.000400
Enterprise6.00050.000600

Todas las cifras son solicitudes por cada 5 minutos. En las organizaciones, los límites se aplican a cada miembro por separado, no al grupo. Los proveedores de inferencia individuales pueden añadir límites propios por encima, así que lee el cuerpo del error antes de decidir qué capa dijo que no.

Cómo leer los encabezados RateLimit

Cada llamada limitada devuelve 429 Too Many Requests. Las respuestas siguen el borrador de la IETF para encabezados de límite de tasa: RateLimit indica cuántas solicitudes quedan y los segundos hasta el reinicio, mientras que RateLimit-Policy indica la ventana, por ejemplo 100 solicitudes por cada 5 minutos. Tu página de facturación también muestra tres indicadores en vivo, uno por grupo, que se ponen en rojo cuando cruzas el límite.

La solución más común es casi aburrida: envía tu HF_TOKEN en todas partes. El tráfico anónimo tiene los límites más bajos, y una biblioteca que olvida reenviar el token los agotará rápido.

Un patrón de reintento que funciona

Desde la versión 1.2.0, la biblioteca huggingface_hub lee el encabezado RateLimit ante un 429 y espera exactamente ese tiempo antes de reintentar, en las descargas de archivos y en las llamadas paginadas a la API del Hub. Para tus propias llamadas de inferencia, basta con un pequeño envoltorio de espera exponencial:

import os
import time
from huggingface_hub import InferenceClient

client = InferenceClient(token=os.environ["HF_TOKEN"])

def ask(prompt, retries=4):
    for attempt in range(retries):
        try:
            reply = client.chat.completions.create(
                model="deepseek-ai/DeepSeek-V3-0324",
                messages=[{"role": "user", "content": prompt}],
                max_tokens=200,
            )
            return reply.choices[0].message.content
        except Exception as err:
            if "429" not in str(err):
                raise
            time.sleep(2 ** attempt)
    raise RuntimeError("Still rate limited after retries")

Reparte los trabajos en periodos más largos, prefiere las URL de Resolver a las llamadas a la API del Hub siempre que sea posible, y mejora el plan solo cuando los indicadores demuestren que lo necesitas.

Velocidad en capacidad compartida

Primer plano de una mano sosteniendo un cronómetro de acero cepillado sobre un escritorio de madera

El tráfico gratuito y de bajo costo suele compartir capacidad con todos los demás, y eso se nota en el tiempo de respuesta. Las páginas de precios que revisé no publican ninguna garantía de latencia, así que mídela tú.

  • Cronometra diez solicitudes a distintas horas y anota la mediana y la llamada más lenta.
  • Elige un modelo más pequeño cuando baste una respuesta corta. Menos cómputo significa una factura más baja y una respuesta más rápida.
  • Limita max_tokens para que un modelo charlatán no pueda tardar 30 segundos en responder una pregunta de una línea.
  • Guarda en caché los prompts repetidos en tu propia base de datos en lugar de pagar dos veces.
  • Lanza los trabajos masivos fuera de hora punta y deja que una cola absorba la espera.

Un prototipo puede tolerar una primera respuesta lenta. Un flujo de pago no puede, y ese suele ser el momento en que la gente empieza a mirar hardware dedicado. Lleva un registro sencillo de tus tiempos en una hoja de cálculo, porque un cambio de precios o una semana con mucha carga se detectan mucho mejor cuando tienes una referencia.

Cuándo compensan los Inference Endpoints

Técnico agachado junto a un servidor GPU abierto montado en rack, con una linterna y una tableta en las manos

Los Inference Endpoints te dan una máquina dedicada para un solo modelo. La facturación es por minuto mientras el endpoint está en marcha o inicializándose. Los endpoints pausados no cuestan nada, pero los que se escalan a cero siguen contando contra tu cuota, así que pausa esos endpoints si necesitas liberar el espacio.

Tarifas por hora según el hardware

Estos son los precios de AWS de la página de Inference Endpoints:

HardwareMemoriaTarifa por hora
CPU x1 (1 vCPU)2 GB0,033 $
CPU x4 (4 vCPU)8 GB0,134 $
GPU T4 x114 GB0,50 $
GPU L4 x124 GB0,80 $
GPU A10G x124 GB1,00 $
GPU A100 x180 GB2,50 $
GPU H200 x1141 GB5,00 $

GCP también ofrece una H100 con 80 GB a 10,00 $ por hora.

Lo que cuesta realmente un mes

Multiplica la tarifa por las horas. Un endpoint encendido durante 730 horas cuesta unos 24 $ en la CPU más pequeña, 365 $ en una T4, 730 $ en una A10G y 1.825 $ en una A100. Si lo usas solo 8 horas al día durante 22 días laborables (176 horas), la T4 baja a unos 88 $ y la A10G a 176 $.

💡 Baño de realidad: los 2,00 $ de crédito mensual de PRO dan para unas cuatro horas de un endpoint con T4. Es un presupuesto de prueba para experimentos, no un plan de alojamiento.

Cómo elegir el plan adecuado

Desarrolladores independientes y aficionados

Quédate en la cuenta gratuita mientras haces prototipos con modelos pequeños y el entorno de pruebas. Compra unos pocos dólares de créditos cuando necesites tráfico real y fija un límite de gasto personal con el que te sientas cómodo. PRO se justifica con sus 9 $ cuando también quieres los límites más altos del Hub (2.500 solicitudes API por ventana frente a 1.000), los 2,00 $ de crédito de cómputo y respuestas de soporte más rápidas.

Equipos pequeños y startups

Cuatro compañeros reunidos alrededor de una larga mesa de roble en un espacio de coworking luminoso, mirando un equipo portátil

Los planes de equipo agrupan 2,00 $ por plaza y permiten la facturación centralizada mediante el encabezado X-HF-Bill-To, así que una sola factura cubre los tokens de todos. Fija el límite de gasto desde el primer día y desactiva los proveedores que no uses. Enterprise añade un endpoint para extraer el uso como una serie diaria desglosada por miembro, modelo y proveedor, con solicitudes que aparecen hasta 2 horas después de hacerse.

Estudiantes e investigadores

Estudiante de perfil en una larga mesa de madera de biblioteca con un equipo portátil, libros de texto y un marcador fluorescente

Los presupuestos académicos son ajustados, así que combina tus herramientas. Usa el Hub para las descargas, donde los usuarios gratuitos tienen el grupo más alto, con 5.000 solicitudes de Resolver por cada 5 minutos, haz pequeños experimentos en hardware local y compra créditos solo para la evaluación final. Las organizaciones de Academia Hub obtienen límites de nivel Team: 3.000 solicitudes API, 20.000 de Resolver y 400 de páginas.

Controla el gasto antes de que te sorprenda. La página de ajustes de Inference Providers muestra el uso del mes pasado por modelo y proveedor, mientras que la página de facturación muestra los créditos y los indicadores de límite de tasa. Revisa ambas una vez a la semana.

Vista por encima del hombro de un hombre en una mesa de cafetería mirando un gráfico de barras desenfocado en un equipo portátil, junto a un flat white

Usa los mismos modelos en PicassoIA

Fotógrafo revisando grandes paisajes impresos de lagos de montaña en un estudio al atardecer

Si tu objetivo es usar modelos de pesos abiertos sin estar pendiente de tokens, créditos y errores 429, PicassoIA aloja muchos de ellos en el navegador. La categoría de modelos de lenguaje incluye GPT OSS 120B, Llama 4 Scout Instruct, Qwen3 235B A22B Instruct 2507, DeepSeek v3.1, Kimi K2.6 y el compacto Granite 4.1 8B.

Cómo usar GPT OSS en PicassoIA

GPT OSS 120B es un modelo de pesos abiertos de 120.000 millones de parámetros para redactar textos, resumir, responder preguntas y escribir código. Los ajustes de abajo son los que muestra su página:

  1. Abre la página de GPT OSS 120B y localiza el campo Prompt.
  2. Escribe una instrucción concreta. Indica el formato, el público y la extensión que quieres.
  3. Deja Temperature en su valor predeterminado de 0.1 para respuestas enfocadas y factuales, y súbelo cuando quieras una redacción más variada.
  4. Deja Max Tokens en 2048, el límite de salida predeterminado, o bájalo para respuestas breves.
  5. Toca Top P, Presence Penalty y Frequency Penalty solo si una respuesta larga empieza a repetirse o a sonar plana.
  6. Ejecuta el modelo, lee el resultado y después ajusta el prompt y vuelve a ejecutarlo.
AjustePredeterminadoQué cambia
Temperature0.1Redacción enfocada frente a variada
Top P1Cuánto de amplio es el muestreo del vocabulario
Max Tokens2048Límite de longitud de la respuesta
Presence Penalty0Empuja al modelo hacia temas nuevos
Frequency Penalty0Reduce palabras y frases repetidas

💡 Consejo: Usa el modelo de lenguaje para redactar tus prompts de imagen y luego pégalos en un modelo de texto a imagen. Una sola pestaña del navegador sirve para el borrador y la imagen.

La misma cuenta también da acceso a las categorías de imagen y video. Para imágenes fijas, prueba FLUX 2 Pro, Seedream 4.5, Imagen 4 Fast, P-Image o FLUX Dev, la misma familia que se usa en el ejemplo de precios de arriba. Para movimiento, Wan 2.6 T2V, Veo 3.1 Fast y Seedance 2.0 convierten un prompt de texto en un clip, y PicassoIA Video figura como generador gratuito e ilimitado a partir de texto o de una imagen.

Crea tus propias imágenes hoy

Leer tablas de precios es útil, pero nada supera a escribir un prompt y ver qué sale. Abre PicassoIA, escribe un breve encargo para una foto de producto, un paisaje o un retrato, y deja que un modelo de texto a imagen lo renderice. Después pide a GPT OSS 120B que reescriba tu prompt en tres estados de ánimo distintos y compara los resultados lado a lado.

No necesitas un token, saldo de créditos ni un bucle de reintentos para empezar. Elige un modelo del catálogo completo, prueba algunos prompts y guarda los que te sorprendan. Tu primera imagen está a unos minutos.

Compartir este artículo

Elige tu idioma