Hugging Face Inference API फ़्री टियर: सीमाएँ और प्राइसिंग
मुफ़्त Hugging Face अकाउंट अब मासिक इनफ़रेंस क्रेडिट की सूची नहीं दिखाते, PRO $9 प्रति माह में $2.00 जोड़ता है, और Hub 5-मिनट की विंडो में ट्रैफ़िक को थ्रॉटल करता है। क्रेडिट, रेट लिमिट, बिलिंग नियमों और डेडिकेटेड एंडपॉइंट की लागत के असली आँकड़े देखें।
अगर आपने सर्च बार में Hugging Face Inference API free tier limits and pricing टाइप किया है, तो शायद आप मुफ़्त कॉल्स की एक साफ़ मासिक सीमा की उम्मीद कर रहे थे। अक्टूबर 2026 की स्थिति इससे ज़्यादा जटिल है, और कई फ़ोरम थ्रेड्स व पुराने ट्यूटोरियल अब पुराने हो चुके हैं। पुराना सर्वरलेस Inference API Inference Providers में मिला दिया गया है, और क्रेडिट, बिलिंग और थ्रॉटलिंग के नियम उसी के साथ बदल गए हैं।
इस लेख में बताया गया है कि मुफ़्त अकाउंट आज क्या कर सकता है, PRO सब्सक्रिप्शन क्या जोड़ता है, रेट लिमिट कैसे व्यवहार करती हैं, और प्लेग्राउंड से बाहर निकलने पर असली लागत कहाँ से शुरू होती है। हर आँकड़ा लिखे जाने के समय की आधिकारिक प्राइसिंग, रेट लिमिट और Inference Endpoints पेजों से लिया गया है, इसलिए बजट तय करने से पहले अपने अकाउंट का बिलिंग पेज ज़रूर खोलें।
फ़्री टियर आपको क्या देता है
छोटी बात यह है कि मुफ़्त अकाउंट किसी विचार को आज़माने का तरीका है, प्रोडक्शन के लिए कोई भत्ता नहीं। आपको एक अकाउंट, एक एक्सेस टोकन, Hub, प्लेग्राउंड, और असली ट्रैफ़िक चलाने के लिए क्रेडिट ख़रीदने का विकल्प मिलता है। मौजूदा प्राइसिंग पेज के अनुसार, जो आपको नहीं मिलता वह है शामिल मासिक इनफ़रेंस क्रेडिट का कोई बकेट।
फ़्री अकाउंट्स के लिए क्रेडिट
लिखे जाने के समय, आधिकारिक प्राइसिंग पेज फ़्री यूज़र्स के लिए कोई शामिल मासिक क्रेडिट नहीं दिखाता। फ़्री अकाउंट फिर भी Inference Providers को कॉल कर सकते हैं, लेकिन केवल क्रेडिट ख़रीदने के बाद। कई थर्ड-पार्टी सारांश अब भी फ़्री अकाउंट्स के लिए प्रति माह $0.10 बताते हैं, इसलिए यह आँकड़ा वेब पर बार-बार दिखेगा। अगर आपका अपना बिलिंग पेज कोई सीमा दिखाता है, तो उस पर भरोसा करें। अगर वह कुछ नहीं दिखाता, तो आपके लिए वह सीमा खत्म हो चुकी है।
PRO कहाँ आता है
PRO की कीमत प्रति माह $9 है और इसमें $2.00 के मासिक क्रेडिट शामिल हैं। ये सामान्य-उद्देश्य वाले कंप्यूट क्रेडिट हैं, इसलिए ये Inference Endpoints, Spaces के लिए अपग्रेड किए गए CPU और GPU हार्डवेयर (जिसमें आपके कोटा से ज़्यादा ZeroGPU उपयोग भी शामिल है) और Jobs का भुगतान भी करते हैं। ये हर महीने जमा होते हैं और किसी भी पे-एज़-यू-गो उपयोग के बिल होने से पहले अपने-आप लागू हो जाते हैं।
टीम और एंटरप्राइज़ सीट्स
Team और Enterprise संगठनों को प्रति सीट $2.00 मिलते हैं, जो सभी सदस्यों के बीच साझा होते हैं। इस पूल को खर्च करने के लिए आपको हर रिक्वेस्ट पर संगठन का नाम देना होगा, या तो X-HF-Bill-To हेडर से या Python क्लाइंट के bill_to पैरामीटर से। एडमिन स्पेंडिंग लिमिट भी सेट कर सकते हैं और खास प्रोवाइडर बंद कर सकते हैं।
अकाउंट प्रकार
शामिल मासिक क्रेडिट
अतिरिक्त उपयोग
Free
कोई नहीं
हाँ, क्रेडिट ख़रीदने के बाद
PRO ($9 प्रति माह)
$2.00
हाँ, पे एज़ यू गो
Team या Enterprise
प्रति सीट $2.00
हाँ, पे एज़ यू गो
💡 टिप: क्रेडिट केवल उन रिक्वेस्ट पर लागू होते हैं जो Hugging Face के ज़रिए रूट होती हैं। अगर आप अपना प्रोवाइडर अकाउंट जोड़ते हैं, तो वह प्रोवाइडर सीधे बिल करता है और आपके शामिल क्रेडिट इस्तेमाल नहीं होते।
बिलिंग पर्दे के पीछे कैसे काम करती है
Hugging Face कहता है कि वह प्रोवाइडर की कीमतें बिना किसी मार्कअप के सीधे आगे भेजता है। जो बदलता है वह यह है कि इनवॉइस कौन भेजता है, और यह इस पर निर्भर करता है कि आप कॉल कैसे करते हैं।
रूटेड रिक्वेस्ट बनाम आपका अपना प्रोवाइडर
Hugging Face द्वारा रूटेड
आपका अपना प्रोवाइडर अकाउंट
आपको कौन बिल करता है
Hugging Face
प्रोवाइडर
शामिल क्रेडिट लागू होते हैं
हाँ
नहीं
प्रोवाइडर अकाउंट चाहिए
नहीं
हाँ
किसके लिए बेहतर
सरलता और एक इनवॉइस
बिलिंग पर नियंत्रण, वे प्रोवाइडर जो इंटीग्रेटेड नहीं हैं
रूटेड रिक्वेस्ट डिफ़ॉल्ट हैं। आप अपना Hugging Face टोकन राउटर को भेजते हैं, और राउटर कॉल को प्रोवाइडर तक पहुँचाता है। राउटर router.huggingface.co/v1 पर OpenAI-संगत फ़ॉर्मेट में काम करता है, इसलिए बेस URL और टोकन बदलने के बाद ज़्यादातर मौजूदा OpenAI क्लाइंट कोड चल जाता है।
hf-inference अलग क्यों दिखता है
hf-inference प्रोवाइडर पुराने "Inference API (serverless)" का सीधा उत्तराधिकारी है। शामिल क्रेडिट के बाद, आप कंप्यूट समय को अंतर्निहित हार्डवेयर की कीमत से गुणा करके भुगतान करते हैं। जुलाई 2025 तक यह ज़्यादातर CPU इनफ़रेंस पर केंद्रित है: एम्बेडिंग, टेक्स्ट रैंकिंग, टेक्स्ट क्लासिफ़िकेशन और BERT या GPT-2 जैसे ऐतिहासिक महत्व के छोटे मॉडल। बड़े चैट मॉडल और इमेज जनरेटर आम तौर पर इसके बजाय पार्टनर प्रोवाइडर सर्व करते हैं।
असली आँकड़ों के साथ लागत का उदाहरण
प्राइसिंग डॉक्स में एक हल किया हुआ उदाहरण है। FLUX.1-dev के लिए एक रिक्वेस्ट, जो GPU पर 10 सेकंड लेती है और जिसकी लागत $0.00012 प्रति सेकंड है, $0.0012 में बिल होती है। इस दर पर:
$2.00 का PRO क्रेडिट लगभग 1,666 इमेज का खर्च उठाता है।
$0.10 (वह भत्ता जिसका पुरानी पोस्ट ज़िक्र करती हैं) लगभग 83 इमेज का खर्च उठा लेता।
इसे एक उदाहरण मानें। असली कीमतें मॉडल और प्रोवाइडर के हिसाब से बदलती हैं, और आपकी अपनी रिक्वेस्ट 10 सेकंड से ज़्यादा समय ले सकती हैं। महीने में कुछ सौ टेस्ट इमेज उस क्रेडिट में आराम से आ जाती हैं, जबकि असली यूज़र्स की सेवा करने वाला पब्लिक ऐप उसे एक दोपहर में ख़त्म कर सकता है।
रेट लिमिट और 429 एरर
बिलिंग से अलग, Hub रिक्वेस्ट को 5-मिनट की फ़िक्स्ड विंडो में थ्रॉटल करता है। नीचे दिए मान रेट लिमिट पेज की सितंबर 2025 की तालिका से लिए गए हैं, और डॉक्स बताते हैं कि अनाम और फ़्री संख्याएँ प्लेटफ़ॉर्म की स्थिति के आधार पर बदल सकती हैं।
तीन रिक्वेस्ट बकेट
Hugging Face ट्रैफ़िक को तीन बकेट में बाँटता है:
Hub APIs: मॉडल और डेटासेट सर्च, रेपो बनाना, यूज़र मैनेजमेंट।
Resolvers:/resolve/ वाले URL, जो लाइब्रेरी और ऐप्स को मॉडल और डेटासेट फ़ाइलें देते हैं।
Pages: huggingface.co के वेब पेज।
प्लान
API
Resolvers
Pages
अनाम (प्रति IP)
500
3,000
100
Free
1,000
5,000
200
PRO
2,500
12,000
400
Team
3,000
20,000
400
Enterprise
6,000
50,000
600
सभी संख्याएँ प्रति 5 मिनट रिक्वेस्ट हैं। संगठनों के लिए, सीमाएँ समूह पर नहीं, बल्कि हर सदस्य पर अलग से लागू होती हैं। अलग-अलग इनफ़रेंस प्रोवाइडर इनके अलावा अपनी अतिरिक्त सीमाएँ भी जोड़ सकते हैं, इसलिए यह तय करने से पहले कि किस लेयर ने मना किया, एरर बॉडी ज़रूर पढ़ें।
RateLimit हेडर पढ़ना
हर थ्रॉटल की गई कॉल 429 Too Many Requests लौटाती है। रिस्पॉन्स IETF के रेट लिमिट हेडर ड्राफ़्ट का पालन करते हैं: RateLimit बताता है कि कितनी रिक्वेस्ट बाकी हैं और रीसेट तक कितने सेकंड बचे हैं, जबकि RateLimit-Policy विंडो बताता है, जैसे 5 मिनट में 100 रिक्वेस्ट। आपका बिलिंग पेज तीन लाइव गेज भी दिखाता है, हर बकेट के लिए एक, जो सीमा पार करने पर लाल हो जाते हैं।
सबसे आम उपाय लगभग उबाऊ है: हर जगह अपना HF_TOKEN भेजें। अनाम ट्रैफ़िक सबसे निचली सीमाओं पर रहता है, और जो लाइब्रेरी टोकन आगे भेजना भूल जाती है, वह उन सीमाओं को तेज़ी से ख़त्म कर देगी।
एक रिट्राई पैटर्न जो काम करता है
संस्करण 1.2.0 से, huggingface_hub लाइब्रेरी 429 पर RateLimit हेडर पढ़ती है और रिट्राई से पहले ठीक उतनी देर इंतज़ार करती है, फ़ाइल डाउनलोड और पेजिनेटेड Hub API कॉल्स के लिए। अपनी इनफ़रेंस कॉल्स के लिए एक छोटा बैकऑफ़ रैपर काफ़ी है:
import os
import time
from huggingface_hub import InferenceClient
client = InferenceClient(token=os.environ["HF_TOKEN"])
def ask(prompt, retries=4):
for attempt in range(retries):
try:
reply = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324",
messages=[{"role": "user", "content": prompt}],
max_tokens=200,
)
return reply.choices[0].message.content
except Exception as err:
if "429" not in str(err):
raise
time.sleep(2 ** attempt)
raise RuntimeError("Still rate limited after retries")
काम को लंबी अवधि में फैलाएँ, जहाँ संभव हो Hub API कॉल्स की जगह Resolver URL चुनें, और अपग्रेड तभी करें जब गेज साबित करें कि आपको इसकी ज़रूरत है।
साझा क्षमता पर स्पीड
फ़्री और कम लागत वाला ट्रैफ़िक आम तौर पर बाकी सभी के साथ क्षमता साझा करता है, और यह रिस्पॉन्स टाइम में दिखता है। मैंने जिन प्राइसिंग पेजों को देखा, उनमें कोई लेटेंसी गारंटी प्रकाशित नहीं है, इसलिए अपना खुद मापें।
दस रिक्वेस्ट अलग-अलग समय पर चलाएँ और मीडियन व सबसे धीमी कॉल दर्ज करें।
जब छोटा जवाब काफ़ी हो तब छोटा मॉडल चुनें। कम कंप्यूट का मतलब छोटा बिल और तेज़ जवाब।
max_tokens सीमित करें, ताकि कोई बातूनी मॉडल एक लाइन के सवाल पर 30 सेकंड तक न चलता रहे।
बार-बार आने वाले प्रॉम्प्ट अपने डेटाबेस में कैश करें, ताकि दोबारा भुगतान न करना पड़े।
बल्क जॉब्स ऑफ़-पीक समय पर चलाएँ और इंतज़ार को एक queue में संभालने दें।
एक प्रोटोटाइप धीमा पहला जवाब बर्दाश्त कर सकता है। चेकआउट फ़्लो उसे बर्दाश्त नहीं कर सकता, और ज़्यादातर तभी लोग डेडिकेटेड हार्डवेयर देखना शुरू करते हैं। अपने टाइमिंग का एक छोटा लॉग स्प्रेडशीट में रखें, क्योंकि जब आपके पास बेसलाइन होती है, तब प्राइसिंग बदलाव या व्यस्त हफ़्ता पहचानना कहीं आसान होता है।
Inference Endpoints कब फ़ायदेमंद होते हैं
Inference Endpoints आपको एक मॉडल के लिए एक डेडिकेटेड मशीन देते हैं। जब एंडपॉइंट चल रहा हो या इनिशियलाइज़ हो रहा हो, तब बिलिंग प्रति मिनट होती है। पॉज़ किए गए एंडपॉइंट का कोई खर्च नहीं होता, जबकि शून्य तक स्केल किए गए एंडपॉइंट अब भी आपके कोटा में गिने जाते हैं, इसलिए अगर आपको स्लॉट वापस चाहिए तो उन्हें पॉज़ करें।
हार्डवेयर के अनुसार प्रति घंटा दरें
ये Inference Endpoints पेज की AWS कीमतें हैं:
हार्डवेयर
मेमोरी
प्रति घंटा दर
CPU x1 (1 vCPU)
2 GB
$0.033
CPU x4 (4 vCPUs)
8 GB
$0.134
GPU T4 x1
14 GB
$0.50
GPU L4 x1
24 GB
$0.80
GPU A10G x1
24 GB
$1.00
GPU A100 x1
80 GB
$2.50
GPU H200 x1
141 GB
$5.00
GCP भी 80 GB वाला H100 $10.00 प्रति घंटा पर सूचीबद्ध करता है।
एक महीने की असली लागत
दर को घंटों से गुणा करें। 730 घंटे तक चालू रहने वाले एंडपॉइंट की लागत सबसे छोटे CPU पर लगभग $24, T4 पर $365, A10G पर $730 और A100 पर $1,825 है। अगर आप इसे 22 कार्यदिवसों पर रोज़ 8 घंटे चलाते हैं (176 घंटे), तो T4 लगभग $88 और A10G लगभग $176 पर आ जाता है।
💡 असलियत की जाँच: PRO का $2.00 मासिक क्रेडिट लगभग चार घंटे के T4 एंडपॉइंट के बराबर है। यह प्रयोगों के लिए एक ट्रायल बजट है, होस्टिंग प्लान नहीं।
सही प्लान चुनना
सोलो डेवलपर और हॉबिस्ट
छोटे मॉडल और प्लेग्राउंड से प्रोटोटाइप करते समय फ़्री अकाउंट पर रहें। जब असली ट्रैफ़िक चाहिए तब कुछ डॉलर के क्रेडिट ख़रीदें, और एक निजी स्पेंडिंग कैप सेट करें जिसके साथ आप सहज हों। PRO अपनी $9 की कीमत तब वसूल करता है जब आपको ऊँची Hub सीमाएँ (विंडो में 1,000 के मुकाबले 2,500 API रिक्वेस्ट), $2.00 का कंप्यूट क्रेडिट और तेज़ सपोर्ट रिस्पॉन्स भी चाहिए।
छोटी टीमें और स्टार्टअप
Team प्लान प्रति सीट $2.00 को साझा करते हैं और X-HF-Bill-To हेडर के ज़रिए केंद्रीकृत बिलिंग की अनुमति देते हैं, इसलिए एक इनवॉइस सबके टोकन का भुगतान करता है। पहले ही दिन स्पेंडिंग लिमिट सेट करें और जो प्रोवाइडर आप इस्तेमाल नहीं करते उन्हें बंद करें। Enterprise में एक एंडपॉइंट जुड़ता है जो उपयोग को रोज़ाना सीरीज़ के रूप में खींचता है, जो सदस्य, मॉडल और प्रोवाइडर के अनुसार बँटी होती है, और रिक्वेस्ट बनाने के 2 घंटे बाद तक दिखाई दे सकती हैं।
छात्र और शोधकर्ता
अकादमिक बजट तंग होते हैं, इसलिए अपने टूल्स मिलाकर इस्तेमाल करें। डाउनलोड के लिए Hub चलाएँ, जहाँ फ़्री यूज़र्स को 5 मिनट में 5,000 Resolver रिक्वेस्ट के सबसे ऊँचे बकेट मिलते हैं, छोटे प्रयोग लोकल हार्डवेयर पर करें, और क्रेडिट केवल अंतिम मूल्यांकन रन के लिए ख़रीदें। Academia Hub संगठनों को 3,000 API, 20,000 Resolver और 400 पेज रिक्वेस्ट की Team-स्तर की सीमाएँ मिलती हैं।
खर्च पर नज़र रखें, इससे पहले कि वह आपको चौंका दे। Inference Providers सेटिंग्स पेज मॉडल और प्रोवाइडर के अनुसार पिछले महीने का उपयोग दिखाता है, जबकि बिलिंग पेज क्रेडिट और रेट लिमिट गेज दिखाता है। हफ़्ते में एक बार दोनों जाँचें।
GPT OSS 120B एक 120-बिलियन-पैरामीटर ओपन-वेट मॉडल है, जो लेखन, सारांश, Q&A और कोड के लिए है। नीचे की सेटिंग्स वही हैं जो उसका पेज दिखाता है:
GPT OSS 120B पेज खोलें और Prompt फ़ील्ड ढूँढें।
एक साफ़-साफ़ निर्देश लिखें। वह फ़ॉर्मेट, ऑडियंस और लंबाई बताएँ जो आपको चाहिए।
तथ्यात्मक, केंद्रित जवाबों के लिए Temperature को डिफ़ॉल्ट 0.1 पर रखें, और ज़्यादा विविध शब्दों के लिए बढ़ाएँ।
Max Tokens को डिफ़ॉल्ट आउटपुट सीमा 2048 पर छोड़ें, या छोटे जवाबों के लिए घटाएँ।
Top P, Presence Penalty और Frequency Penalty को तभी छुएँ जब लंबा जवाब लूप करने लगे या फीका लगे।
मॉडल चलाएँ, नतीजा पढ़ें, फिर प्रॉम्प्ट को और कसें और दोबारा चलाएँ।
सेटिंग
डिफ़ॉल्ट
क्या बदलती है
Temperature
0.1
केंद्रित बनाम विविध शब्दावली
Top P
1
मॉडल शब्दावली को कितनी व्यापकता से सैंपल करता है
Max Tokens
2048
जवाब की लंबाई की सीमा
Presence Penalty
0
मॉडल को नए विषयों की ओर धकेलता है
Frequency Penalty
0
दोहराए गए शब्दों और वाक्यांशों को घटाता है
💡 टिप: लैंग्वेज मॉडल से अपने इमेज प्रॉम्प्ट लिखवाएँ, फिर उन्हें टेक्स्ट-टू-इमेज मॉडल में पेस्ट करें। एक ब्राउज़र टैब ड्राफ़्ट और तस्वीर दोनों संभाल लेता है।
प्राइसिंग टेबल पढ़ना उपयोगी है, लेकिन प्रॉम्प्ट चलाकर देखना कि क्या वापस आता है, इससे बेहतर कुछ नहीं। PicassoIA खोलें, किसी प्रोडक्ट शॉट, लैंडस्केप या पोर्ट्रेट के लिए एक छोटा ब्रीफ़ लिखें, और टेक्स्ट-टू-इमेज मॉडल को उसे रेंडर करने दें। फिर GPT OSS 120B से अपने प्रॉम्प्ट को तीन अलग मूड में दोबारा लिखवाएँ और नतीजों की साथ-साथ तुलना करें।
शुरू करने के लिए आपको टोकन, क्रेडिट बैलेंस या रिट्राई लूप की ज़रूरत नहीं है। पूरी कैटलॉग से कोई मॉडल चुनें, कुछ प्रॉम्प्ट आज़माएँ, और जो आपको चौंकाएँ उन्हें रखें। आपकी पहली इमेज बस कुछ मिनट दूर है।